中文

论离策略强化学习中的重用偏差

机器学习 2025-05-20 v3

摘要

重要性采样(IS)是离策略评估中一种流行的技术,它对回放缓冲区中轨迹的回报进行重加权以提升样本效率。然而,使用 IS 训练可能不稳定,以往解决该问题的尝试主要集中于分析 IS 的方差。在本文中,我们揭示这种不稳定性还与一个称为 IS 重用偏差(Reuse Bias)的新概念有关——即因将回放缓冲区同时用于评估和优化而导致的离策略评估偏差。我们从理论上表明,使用回放缓冲区数据对当前策略进行离策略评估与优化会导致对目标函数的高估,这可能引起错误的梯度更新并降低性能。我们进一步给出了重用偏差的高概率上界,并表明通过引入离策略算法稳定性概念,控制该上界的一项即可控制重用偏差。基于这些分析,我们最终提出了一种新颖的偏差正则化重要性采样(BIRIS)框架及实用算法,可缓解重用偏差的负面影响。实验结果表明,我们基于 BIRIS 的方法在 MuJoCo 的一系列连续控制任务上能显著提升样本效率。

关键词

引用

@article{arxiv.2209.07074,
  title  = {On the Reuse Bias in Off-Policy Reinforcement Learning},
  author = {Chengyang Ying and Zhongkai Hao and Xinning Zhou and Hang Su and Dong Yan and Jun Zhu},
  journal= {arXiv preprint arXiv:2209.07074},
  year   = {2025}
}