中文

通过随机化回报分解学习长期回报重分配

机器学习 2022-03-18 v2 人工智能 机器学习

摘要

强化学习的许多实际应用要求智能体从稀疏和延迟的奖励中学习。这挑战了智能体将其行为归因于未来结果的能力。在本文中,我们考虑了具有轨迹反馈的情景强化学习的问题表述。它指的是奖励信号的极端延迟,其中智能体只能在每条轨迹结束时获得一个奖励信号。针对此问题设置的一个流行范式是使用设计的辅助密集奖励函数(即代理奖励)代替稀疏的环境信号进行学习。基于此框架,本文提出了一种新颖的回报重分配算法——随机化回报分解(RRD),用于学习情景强化学习的代理奖励函数。我们通过蒙特卡洛抽样建立了一个替代问题,将基于最小二乘的回报重分配扩展到长时序问题。我们通过与文献中现有方法的联系分析了替代损失函数,阐明了我们方法的算法特性。在实验中,我们在各种具有情景奖励的基准任务上广泛评估了所提出的方法,并展示出相对于基线算法的显著改进。

关键词

引用

@article{arxiv.2111.13485,
  title  = {Learning Long-Term Reward Redistribution via Randomized Return Decomposition},
  author = {Zhizhou Ren and Ruihan Guo and Yuan Zhou and Jian Peng},
  journal= {arXiv preprint arXiv:2111.13485},
  year   = {2022}
}

备注

Tenth International Conference on Learning Representations (ICLR 2022 Spotlight)