离线逆强化学习
机器学习
2021-06-10 v1
摘要
离线 RL 的目标是在仅有固定探索性演示数据集可用且无法额外采样观测时(通常若该操作成本高昂或引发伦理问题)学习最优策略。为解决此问题,现成方法需要恰当定义的代价函数(或其在所提供数据集上的评估),而这在实践中很少可用。为规避该问题,一个合理的替代方案是向专家查询少量最优演示,以补充探索性数据集。目标随后变为针对专家的潜在代价函数学习最优策略。当前解决方案要么求解行为克隆问题(未利用探索性数据),要么求解强化模仿学习问题(使用固定代价函数区分可用探索性轨迹与专家轨迹)。受 IRL 技术在线设定中取得最优模仿性能的启发,我们利用基于 GAN 的数据增强过程构建了首个离线 IRL 算法。所得策略在多个 OpenAI gym 环境中优于上述解决方案。
引用
@article{arxiv.2106.05068,
title = {Offline Inverse Reinforcement Learning},
author = {Firas Jarboui and Vianney Perchet},
journal= {arXiv preprint arXiv:2106.05068},
year = {2021}
}