CLARE:面向离线逆强化学习的基于保守模型的奖励学习
机器学习
2023-02-22 v2 人工智能
摘要
本工作旨在解决离线逆强化学习(IRL)中的一个主要挑战,即奖励外推误差:由于固有的协变量偏移,学到的奖励函数可能无法正确解释任务并在未见环境中误导智能体。利用专家数据和低质量多样数据,我们设计了一种原则性算法(即 CLARE),通过将“保守性”整合进学到的奖励函数并利用估计的动态模型,高效求解离线 IRL。我们的理论分析给出了所学策略与专家策略之间回报差距的上界,并据此通过考察对专家数据与多样数据的利用与对估计动态模型的探索之间的微妙两层权衡来刻画协变量偏移的影响。我们表明 CLARE 能够通过在此中取得恰当的利用-探索平衡而可证明地缓解奖励外推误差。大量实验证实,在 MuJoCo 连续控制任务(尤其在小型离线数据集下)上 CLARE 相较现有最优算法有显著性能提升,且所学奖励对进一步学习极具指导性。
引用
@article{arxiv.2302.04782,
title = {CLARE: Conservative Model-Based Reward Learning for Offline Inverse Reinforcement Learning},
author = {Sheng Yue and Guanbo Wang and Wei Shao and Zhaofeng Zhang and Sen Lin and Ju Ren and Junshan Zhang},
journal= {arXiv preprint arXiv:2302.04782},
year = {2023}
}