基于可解释多示例学习从轨迹标签进行非马尔可夫奖励建模
机器学习
2022-10-11 v2 人工智能
摘要
我们将强化学习(RL)中的奖励建模(RM)问题推广到处理非马尔可夫奖励。现有工作假设人类评估者在提供关于智能体行为的反馈时独立地观察轨迹中的每一步。在本工作中,我们去除这一假设,将 RM 扩展以捕捉人类轨迹评估中的时间依赖性。我们展示了如何将 RM 作为多示例学习(MIL)问题来处理,其中轨迹被视为带有回报标签的包,而轨迹中的步骤是带有未观测奖励标签的示例。我们进一步开发了能够捕捉已标注轨迹中时间依赖性的新 MIL 模型。我们在一系列 RL 任务上证明,我们的新 MIL 模型能够以很高的准确度重建奖励函数,并可用于训练高性能的智能体策略。
引用
@article{arxiv.2205.15367,
title = {Non-Markovian Reward Modelling from Trajectory Labels via Interpretable Multiple Instance Learning},
author = {Joseph Early and Tom Bewley and Christine Evers and Sarvapali Ramchurn},
journal= {arXiv preprint arXiv:2205.15367},
year = {2022}
}
备注
27 pages (10 main content; 2 references; 1 checklist; 14 appendix). 14 figures (9 main content; 5 appendix). Published at NeurIPS 2022. Revisions: v2) Updated to NeurIPS camera ready version (extra experiments)