注意差距:面向不完美奖励的离线策略优化
机器学习
2023-02-06 v1 人工智能
摘要
奖励函数在强化学习(RL)中至关重要,作为激励智能体解决给定任务的引导信号,但也众所周知难以设计。在许多情况下,仅有不完美奖励可用,这给 RL 智能体带来显著的性能损失。在本研究中,我们提出一种统一的离线策略优化方法,\textit{RGM(奖励差距最小化)},可智能处理多种类型的不完美奖励。RGM 被表述为一个双层优化问题:上层优化一个奖励修正项,该修正项针对某些专家数据执行访问分布匹配;下层使用修正后的奖励求解一个悲观 RL 问题。通过利用下层的对偶性,我们推导出一种可处理的算法,支持无需任何在线交互的基于采样的学习。综合实验表明,RGM 在不同不完美奖励设置下均取得优于现有方法的性能。此外,RGM 能有效纠正违背专家偏好的错误或不一致奖励,并从有偏奖励中检索有用信息。
引用
@article{arxiv.2302.01667,
title = {Mind the Gap: Offline Policy Optimization for Imperfect Rewards},
author = {Jianxiong Li and Xiao Hu and Haoran Xu and Jingjing Liu and Xianyuan Zhan and Qing-Shan Jia and Ya-Qin Zhang},
journal= {arXiv preprint arXiv:2302.01667},
year = {2023}
}
备注
Accept by ICLR2023. The first two authors contributed equally