通过抽象状态逆向学习可迁移奖励
机器学习
2026-05-28 v4 机器人学
摘要
逆强化学习(IRL)在从行为数据中准确学习离散和连续域的底层奖励方面取得了显著进展。下一个进展是以能够产生有用行为的方式学习内在偏好,这些行为所在的设置或任务与观察到的不同但保持一致。在机器人应用的背景下,这有助于将机器人集成到涉及新任务(具有共享的内在偏好)的加工流水线中,而无需从头编程。我们提出了一种从两个或多个不同域实例中的行为轨迹逆向学习抽象奖励函数的方法。然后,该抽象奖励函数被用于学习该域中另一个独立实例的任务行为。这一步提供了其可迁移性的证据并验证了其正确性。我们在 OpenAI 的 Gym 测试平台和 AssistiveGym 中多个域的任务轨迹上评估了该方法,并表明学习到的抽象奖励函数能够成功地在各自域中先前未见过的实例中学习任务行为。
引用
@article{arxiv.2501.01669,
title = {Inversely Learning Transferable Rewards via Abstracted States},
author = {Yikang Gui and Prashant Doshi},
journal= {arXiv preprint arXiv:2501.01669},
year = {2026}
}
备注
Accepted at IJCAI 2026