-
Notifications
You must be signed in to change notification settings - Fork 4.4k
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
- Status: Open.#6708 In NVIDIA/Megatron-LM;
[RL][Performance] Avoid full-vocabulary TP gather for selected-token logprobs
enhancementNew feature or requestNew feature or requestStatus: Open.#6700 In NVIDIA/Megatron-LM;Layer-sharded Muon: one Newton-Schulz home per weight over (GTP × TP)
enhancementNew feature or requestNew feature or requestStatus: Open.#6676 In NVIDIA/Megatron-LM;[Megatron-FSDP] Gradients doubled every microbatch (2^N amplification) when a grad buffer's DP group has size 1 (EP=DP or DP=1) with optim_grads_params
bugSomething isn't workingSomething isn't workingStatus: Open.#6660 In NVIDIA/Megatron-LM;- Status: Open.#6656 In NVIDIA/Megatron-LM;
- Status: Open.#6653 In NVIDIA/Megatron-LM;
Extract the OpenTelemetry span-lifecycle helpers out of megatron/training/training.py
enhancementNew feature or requestNew feature or requestStatus: Open.#6631 In NVIDIA/Megatron-LM;- Status: Open.#6619 In NVIDIA/Megatron-LM;
- Status: Open.#6609 In NVIDIA/Megatron-LM;
- Status: Open.#6607 In NVIDIA/Megatron-LM;
- Status: Open.#6603 In NVIDIA/Megatron-LM;
- Status: Open.#6600 In NVIDIA/Megatron-LM;