解析奖励塑形:理解奖励工程在样本复杂度上的收益
机器学习
2022-10-19 v1 人工智能
摘要
强化学习提供了一种从高阶奖励规范中学习行为的自动化框架,但在实践中奖励函数的选择对取得良好结果至关重要——原则上奖励只需指定任务是什么,但实际上从业者往往需设计更详细的奖励,为智能体提供关于应如何完成任务的某些提示。这类“奖励塑形”的思想在文献中常被讨论,且通常是实际应用的关键部分,但关于奖励塑形的选择如何在样本复杂度上带来收益,尚缺乏较为形式化的刻画。本工作中,我们基于新颖性驱动探索的框架,提出一种将塑形奖励纳入强化学习的简单方案,并给出一种分析工具,表明特定奖励塑形选择可证明地改善样本效率。我们刻画了预期收益显著的问题类别,并展示其如何与文献中的实用算法相联系。我们通过实验评估确认这些结果在实践中的成立,从而深入揭示了奖励塑形在保持渐近性能的同时可显著改善强化学习复杂度的机制。
引用
@article{arxiv.2210.09579,
title = {Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity},
author = {Abhishek Gupta and Aldo Pacchiano and Yuexiang Zhai and Sham M. Kakade and Sergey Levine},
journal= {arXiv preprint arXiv:2210.09579},
year = {2022}
}