优化器 (3)(Gram Newton-Schulz)
本文介绍了 Gram Newton-Schulz 算法,这是 Muon 优化器中 Newton-Schulz 正交化过程的高效变体。通过在 Gram 矩阵上迭代而非原矩阵,Gram Newton-Schulz 显著减少了 FLOPs 和运行时间。本文详细推导了算法的数学原理,分析了数值稳定性问题,并给出了完整的理论证明。
共 2 篇文章
本文介绍了 Gram Newton-Schulz 算法,这是 Muon 优化器中 Newton-Schulz 正交化过程的高效变体。通过在 Gram 矩阵上迭代而非原矩阵,Gram Newton-Schulz 显著减少了 FLOPs 和运行时间。本文详细推导了算法的数学原理,分析了数值稳定性问题,并给出了完整的理论证明。
本文介绍了一种新的优化器Muon。与SGD和Adam等优化器不同,Muon将参数看作一个矩阵,而不是一个向量。这使得Muon能够更好地利用参数的结构信息,获得更稳定的训练过程、更快的收敛速度以及更高的性能上限。在本文中详细介绍了Muon的数学原理,并从范数理论的视角来分析了Muon的优势所在。最后,本文结合Kimi在大规模LLM预训练场景下的实践经验,介绍了几个将Muon应用在大规模模型训练上的经验和工程优化。