中文

TROFI:基于轨迹排序的离线逆强化学习

机器学习 2025-06-30 v1 人工智能

摘要

在离线强化学习中,智能体仅使用来自源策略存储的固定转换集进行训练,但这要求数据集由奖励函数标记。在视频游戏开发等实际应用中,奖励函数的可用性并非总是得到保证。本文提出了轨迹排序离线逆强化学习方法(Trajectory-Ranked OFfline Inverse reinforcement learning, TROFI),以无预定义奖励函数有效学习策略。TROFI首先从人类偏好中学习奖励函数,然后使用该奖励函数对原始数据集进行标记,使其可用于策略训练。与其他方法不同,本方法无需最优轨迹。通过在D4RL基准上的实验,我们展示TROFI在基线方法上始终表现出色,并与使用真实奖励学习策略的性能相当。此外,我们在3D游戏环境中验证了该方法的有效性。我们对奖励模型的研究凸显了奖励函数在该设置中的重要性:我们展示,为确保价值函数与实际折扣未来奖励的对齐,拥有良好设计且易于学习的奖励函数至关重要。

关键词

引用

@article{arxiv.2506.22008,
  title  = {TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning},
  author = {Alessandro Sestini and Joakim Bergdahl and Konrad Tollmar and Andrew D. Bagdanov and Linus Gisslén},
  journal= {arXiv preprint arXiv:2506.22008},
  year   = {2025}
}

备注

Published at Reinforcement Learning and Video Games Workshop at RLC 2025