中文

抓住偶然性:在离策略 Actor-Critic 中利用过往成功的价值

机器学习 2024-05-14 v5 人工智能

摘要

学习高质量的 QQ 值函数在许多现代离策略深度强化学习(RL)算法的成功中起着关键作用。先前的工作主要关注解决价值高估问题,这是采用函数逼近器和离策略学习的结果。与普遍观点不同,我们观察到在 RL 训练过程的后阶段 QQ 值常被低估,这可能阻碍策略学习并降低样本效率。我们发现这种长期被忽视的现象通常源于在 Bellman 更新中使用了来自当前策略的较差动作,而非回放缓冲区中更优的动作样本。为解决此问题,我们的见解是在保持探索乐观的同时充分挖掘过往成功。我们提出了混合利用与探索(BEE)算子,一种简单而有效的方法,它使用历史最佳表现动作和当前策略来更新 QQ 值。基于 BEE,由此得到的实用算法 BAC 在超过 50 个连续控制任务中优于最先进的方法,并在易失败场景和真实世界机器人任务中取得强劲性能。基准结果和视频可在 https://jity16.github.io/BEE/ 获取。

关键词

引用

@article{arxiv.2306.02865,
  title  = {Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic},
  author = {Tianying Ji and Yu Luo and Fuchun Sun and Xianyuan Zhan and Jianwei Zhang and Huazhe Xu},
  journal= {arXiv preprint arXiv:2306.02865},
  year   = {2024}
}

备注

Accepted by ICML 2024