用于常识奖励的多任务逆强化学习
机器学习
2025-10-24 v2
摘要
在复杂的现实世界环境中应用强化学习的挑战之一在于为智能体提供足够详细的奖励函数。奖励与期望行为之间的任何不一致都可能导致不良后果。这可能会引发“奖励黑客”等问题,即智能体通过非预期行为最大化奖励。在这项工作中,我们提议将奖励解耦为两个不同的部分:一个简单的特定任务奖励,概述手头任务的具体细节;以及一个未知的常识奖励,指示智能体在环境中的预期行为。随后,我们探讨了如何从专家演示中学习这种常识奖励。我们首先表明,即使逆强化学习成功训练了智能体,它也未能学到有用的奖励函数。也就是说,使用学到的奖励训练新智能体并不会损害期望的行为。随后,我们证明了这个问题可以通过同时在多个任务上进行训练来解决。也就是说,可以应用多任务逆强化学习来学习有用的奖励函数。
引用
@article{arxiv.2402.11367,
title = {Multi Task Inverse Reinforcement Learning for Common Sense Reward},
author = {Neta Glazer and Aviv Navon and Aviv Shamsian and Ethan Fetaya},
journal= {arXiv preprint arXiv:2402.11367},
year = {2025}
}