中文

注意差距:面向不完美奖励的离线策略优化

机器学习 2023-02-06 v1 人工智能

摘要

奖励函数在强化学习(RL)中至关重要,作为激励智能体解决给定任务的引导信号,但也众所周知难以设计。在许多情况下,仅有不完美奖励可用,这给 RL 智能体带来显著的性能损失。在本研究中,我们提出一种统一的离线策略优化方法,\textit{RGM(奖励差距最小化)},可智能处理多种类型的不完美奖励。RGM 被表述为一个双层优化问题:上层优化一个奖励修正项,该修正项针对某些专家数据执行访问分布匹配;下层使用修正后的奖励求解一个悲观 RL 问题。通过利用下层的对偶性,我们推导出一种可处理的算法,支持无需任何在线交互的基于采样的学习。综合实验表明,RGM 在不同不完美奖励设置下均取得优于现有方法的性能。此外,RGM 能有效纠正违背专家偏好的错误或不一致奖励,并从有偏奖励中检索有用信息。

关键词

引用

@article{arxiv.2302.01667,
  title  = {Mind the Gap: Offline Policy Optimization for Imperfect Rewards},
  author = {Jianxiong Li and Xiao Hu and Haoran Xu and Jingjing Liu and Xianyuan Zhan and Qing-Shan Jia and Ya-Qin Zhang},
  journal= {arXiv preprint arXiv:2302.01667},
  year   = {2023}
}

备注

Accept by ICLR2023. The first two authors contributed equally