读书过程中的摘录、思考与输出,把输入沉淀为可复用的知识。
笔记分类
共 13 个分类 · 49 篇文章
记录本站搭建过程中的技术笔记,涵盖构建、渲染、样式与体验优化。
研究课题的文献综述、实验记录与方案设计。
强化学习理论基础:多臂赌博机、马尔可夫决策过程、动态规划等,以 Sutton《强化学习导论》为主线梳理核心概念与收敛性证明。
强化学习方向的论文精读,涵盖奖励分布匹配、序列级软策略优化、扩散语言模型后训练等前沿工作。
围绕策略熵的理论与工程实践:熵减与训练收敛的关系、双边熵安全策略、RFT 过程中的熵坍塌分析与控制。
从变分推断到扩散模型与流匹配:生成式建模的数学原理、经典模型推导与训练目标分析。
数学基础与经典定理的整理、证明与直观理解。
搜索、广告、推荐系统的论文精读,关注生成式推荐、多目标对齐与工业级排序建模。
随机过程课程笔记:相关函数的时频分析、高斯过程与泊松过程、马尔可夫链的渐进行为等。
记录个人所撰写的研究论文,分享研究经验与发现。
从 SGD、Adam 到 Muon 与 Gram Newton-Schulz:优化器的数学原理、动力学视角与大规模训练中的工程实践。
大语言模型相关的论文解读与工程实践,如高效注意力实现、混合 Mamba-Transformer 架构等。