强化学习基础 (2):有限马尔可夫过程
引言
在本文中,我们将形式化地定义有限马尔可夫过程 (Finite Markov Decision Process) 。在后续的所有内容中,我们都将问题抽象为一个有限MDP。
MDP是线性决策问题的一种经典建模方式。在MDP的每一步中,采取不同的动作不仅对瞬时奖励有影响,也会影响后续的状态。因此,求解一个MDP的最优策略需要在瞬时奖励和未来奖励之间取得较好的平衡。
与赌博机问题不同的是,在MDP中我们需要估计的价值函数是关于动作和状态的函数,即
一、形式化定义
在MDP的定义中,有两个至关重要的角色:智能体 (Agent) 和环境 (Environment)。
具体来说,智能体在离散的时间步上与环境进行多次交互。在每一个时间步
有限MDP中的“有限”是指状态集合
MDP最重要的性质是被称为【马尔可夫性】的性质(也被称为无记忆性),即当前时间步下的奖励
因此对于每一个MDP,都有如下的动力学方程
由于
给定动力学方程
MDP 框架是目标导向学习 (goal-directed learning) 问题的一个抽象表述。它提出,无论感知、记忆和控制方法的细节如何,也无论试图实现的目标是什么,任何学习目标导向行为的问题都可以简化为在智能体与其环境之间来回传递的三个信号:一个信号表示智能体所做的选择(动作),一个信号表示做出选择的基础(状态),以及一个信号定义智能体的目标(奖励)。
二、学习目标
用一句话来说明强化学习的目标就是:最大化智能体在一段时间内获得的累计奖励。
这里的累计奖励(也被称为期望回报)有多种定义方式。比如说最简单的一种定义方式就是把未来得到的所有奖励直接求和:
然而这种定义方式并没有考虑不同时间步上的差异。一般来说,越近时间步上的奖励应当越重要。因此,我们一般用 折扣回报 (discounted return) 来刻画:
其中,
由折扣回报的定义,我们可以写出它的递推式:
三、策略和价值函数
3.1. 策略、价值函数与贝尔曼方程
策略 (policy) 是指从状态空间映射到动作空间到概率分布。具体来说,如果一个智能体在时间步
即智能体在状态
更进一步地,我们可以分别定义策略
状态价值函数一个重要性质是它满足下面的 贝尔曼方程 (Bellman equation):
贝尔曼方程描述了 状态
值得一提的是,状态价值函数
3.2. 求解最优策略与最优价值函数
正如上面所说的,强化学习任务就是找到一个最优的策略
状态价值函数实际上是一个关于策略的偏序函数,如果在所有状态
在这个意义下,我们称比其他所有策略都“更优”的策略为最优策略
注意最优策略可能不止一个,但所有的最优策略都有同样的最优状态价值函数
最优的状态价值函数同样满足贝尔曼方程,特别地,这个方程被称为 贝尔曼最优方程 (Bellman optimality equation):
贝尔曼最优方程实际上描述了下面这样的事实:在最优策略下,状态
同样地,最优动作价值函数也满足以下的贝尔曼最优方程: