基于插值奖励的离线强化学习
机器学习
2024-07-16 v1 人工智能
摘要
离线强化学习(Offline Reinforcement Learning, ORL)为在交互环境成本高、受限于安全或缺乏准确仿真环境的应用中训练智能体提供了稳健方案。尽管其在实际世界部署人工智能体方面具有潜力,但离线强化学习通常需要大量标注了真实奖励的演示数据。因此,当前领先的离线强化学习算法在数据稀缺场景下往往难以应用或无法应用。本文提出一种简单且有效的奖励模型,可从极少数量标注了奖励的环境转换样本中估计奖励信号。当奖励信号被建模后,我们利用该奖励模型对大量无奖励转换样本进行奖励插值,从而支持离线强化学习技术的应用。我们在几个D4RL连续运动任务上展示了该方法的潜力。结果表明,仅使用原始数据集中1%标注奖励的转换样本,我们所学习的奖励模型即可为剩余99%的转换样本插值奖励,据此可学习出性能良好的智能体。
引用
@article{arxiv.2407.10839,
title = {Offline Reinforcement Learning with Imputed Rewards},
author = {Carlo Romeo and Andrew D. Bagdanov},
journal= {arXiv preprint arXiv:2407.10839},
year = {2024}
}
备注
RLBRew Workshop @ RLC 2024