#大语言模型

共 4 篇文章

优化器

优化器 (3)(Gram Newton-Schulz)

本文介绍了 Gram Newton-Schulz 算法,这是 Muon 优化器中 Newton-Schulz 正交化过程的高效变体。通过在 Gram 矩阵上迭代而非原矩阵,Gram Newton-Schulz 显著减少了 FLOPs 和运行时间。本文详细推导了算法的数学原理,分析了数值稳定性问题,并给出了完整的理论证明。

LLM

NVIDIA Nemotron 3 Super 技术解读(Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning)

NVIDIA 正式发布了 Nemotron 3 Super,这是一个专为 AI 智能体设计的开源大模型。工作的主要创新包括:混合 Mamba-Transformer 架构、Latent MoE、多 token 预测以及原生使用 NVFP4 预训练等。这种设计在保持高效推理的同时,实现了强大的推理和编码能力。

LLM

FlashAttention 系列

本文系统介绍了 FlashAttention 系列工作的技术演进,从 FlashAttention 1 的 IO-aware 设计,到 FlashAttention 2 的并行化优化,再到后续版本针对 H100 和 Blackwell 架构的硬件适配。通过本文,读者可以理解高效 Attention 实现的核心思想,以及硬件感知算法设计的重要性。

优化器

优化器 (2):Muon

本文介绍了一种新的优化器Muon。与SGD和Adam等优化器不同,Muon将参数看作一个矩阵,而不是一个向量。这使得Muon能够更好地利用参数的结构信息,获得更稳定的训练过程、更快的收敛速度以及更高的性能上限。在本文中详细介绍了Muon的数学原理,并从范数理论的视角来分析了Muon的优势所在。最后,本文结合Kimi在大规模LLM预训练场景下的实践经验,介绍了几个将Muon应用在大规模模型训练上的经验和工程优化。