#优化理论

共 3 篇文章

优化器

优化器 (3)(Gram Newton-Schulz)

本文介绍了 Gram Newton-Schulz 算法,这是 Muon 优化器中 Newton-Schulz 正交化过程的高效变体。通过在 Gram 矩阵上迭代而非原矩阵,Gram Newton-Schulz 显著减少了 FLOPs 和运行时间。本文详细推导了算法的数学原理,分析了数值稳定性问题,并给出了完整的理论证明。

优化器

优化器 (2):Muon

本文介绍了一种新的优化器Muon。与SGD和Adam等优化器不同,Muon将参数看作一个矩阵,而不是一个向量。这使得Muon能够更好地利用参数的结构信息,获得更稳定的训练过程、更快的收敛速度以及更高的性能上限。在本文中详细介绍了Muon的数学原理,并从范数理论的视角来分析了Muon的优势所在。最后,本文结合Kimi在大规模LLM预训练场景下的实践经验,介绍了几个将Muon应用在大规模模型训练上的经验和工程优化。

优化器

优化器 (1):SGD和Adam

本文深入探讨了机器学习优化器的基本原理,从梯度下降开始,逐步深入以SGD和Adam为代表的现代机器学习优化器,展示了其理论基础和工程实践相结合的魅力。此外,本文从动力学的视角理解了某些优化器,可以为读者提供一些新的理解和启发。