#策略梯度

共 1 篇文章

强化学习中的熵

强化学习中的熵 (1):策略熵

本文探讨了强化学习中的策略熵 (policy entropy),主要从理论上回答了两大问题:1. 为什么熵减往往意味着训练收敛;2. 策略梯度算法如何改变策略熵。从这两个问题的答案我们可以看出,策略梯度算法会导致策略熵的减小,从而使得策略收敛下来,这给了我们一个新的视角来看待强化学习的训练过程。