通过减少价值和策略波动的链式效应来提高深层强化学习
机器学习
2024-12-12 v2 人工智能
摘要
深度神经网络为强化学习(RL)提供了强大的函数逼近器,以解决大规模决策问题。然而,这些逼近器由于 RL 训练的非平稳性质,带来了挑战。RL 挑战的一个来源是输出预测会产生波动,导致每个小批量更新后对不包含在小批量中的状态产生不可控制的变化。尽管这种波动现象存在于每个训练步骤中,但如何发生以及对 RL 的影响仍未得到充分探索。在本工作中,我们首先通过函数逼近视角对波动进行表征,并发现价值估计和策略改进之间的波动会导致一种链式效应,使得波动在迭代过程中相互叠加并偏向学习动力学。进一步地,我们具体化了研究,关注链式效应在不同设置下造成的学习问题,包括基于价值的 метод中的贪心动作偏差、近端策略优化中的信任区间违规以及 actor-critic 方法中的双向偏差。我们随后提出一种方法来减少不同设置下的链式效应,称为 Churn Approximated ReductIoN(CHAIN),可轻松集成到大多数现有 DRL 算法中。我们的实验表明,该方法在减少波动和改进学习性能方面有效,适用于在线和离线、基于价值和基于策略的 RL 设置,以及扩展设置。
引用
@article{arxiv.2409.04792,
title = {Improving Deep Reinforcement Learning by Reducing the Chain Effect of Value and Policy Churn},
author = {Hongyao Tang and Glen Berseth},
journal= {arXiv preprint arXiv:2409.04792},
year = {2024}
}
备注
Accepted to NeurIPS 2024. Project page: https://bluecontra.github.io/CHAIN