中文

用一步 Q-learning 缓解 Actor-Critic 方法中的离屏偏差:一种新颖校正方法

机器学习 2023-09-27 v4 人工智能

摘要

相较于同策略方法,离屏无模型深度强化学习可通过重复使用先前收集的数据来提高数据效率。然而,当智能体策略与所收集数据的底层分布之间差异增大时,离屏学习变得困难。尽管已有深入研究的重要性采样与离屏策略梯度技术被提出以补偿该差异,它们通常需要收集长轨迹并引发如梯度消失/爆炸或丢弃许多有用经验等额外问题,最终增加了计算复杂度。此外,它们向连续动作域或由确定性深度神经网络近似的策略的推广受到严格限制。为克服这些局限,我们引入一种新颖的策略相似度度量,以缓解连续控制中此类差异的影响。我们的方法提供了一种适用于确定性策略网络的充分单步离屏校正。理论与实证研究表明,它可实现“安全”的离屏学习,并通过在 Q-learning 与策略优化中有效的学习率调度,以比竞争方法更少的步数获得更高回报,从而大幅改进现有最优水平。

关键词

引用

@article{arxiv.2208.00755,
  title  = {Mitigating Off-Policy Bias in Actor-Critic Methods with One-Step Q-learning: A Novel Correction Approach},
  author = {Baturay Saglam and Dogan C. Cicek and Furkan B. Mutlu and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:2208.00755},
  year   = {2023}
}