#马尔可夫决策过程

共 2 篇文章

强化学习基础

强化学习基础 (3):动态规划求解

本文探讨了强化学习中的动态规划 (Dynamic Programming, DP) 算法,DP算法是一种用于求解MDP问题的最优策略的一系列算法,其核心思想在于:利用价值函数来指导和描述能够得到最优策略的搜索方法。文中详细介绍了两种非常经典的DP算法:策略迭代和值迭代,这是现代强化学习算法的基石。最后,文章通过引入巴拿赫不动点理论,从数学上严格证明了DP算法的收敛性。

强化学习基础

强化学习基础 (2):有限马尔可夫过程

本文探讨了强化学习中的有限马尔可夫过程 (Finite Markov Decision Process) 的基本概念和数学建模。文中深入介绍了强化学习中一些非常重要的概念和定义,比如说:策略、价值函数、贝尔曼方程、最优策略等,是理解所有强化学习算法的基础。