中文

MEReQ:基于最大熵残差-Q 逆强化学习的干预样本高效对齐方法

机器人学 2025-10-27 v4 人工智能 机器学习

摘要

将机器人行为与人类偏好进行对齐,对于在以人为中心的环境中部署具身 AI 智能体至关重要。一个有前景的解决方案是从人类干预中进行交互式模仿学习,其中人类专家观察策略执行并提供干预作为反馈。然而,现有方法往往未有效利用先验策略来促进学习,从而限制了样本效率。在本工作中,我们引入 MEReQ(Maximum-Entropy Residual-Q Inverse Reinforcement Learning),用于来自人类干预的样本高效对齐。MEReQ 通过推断捕获人类专家与先验策略之间底层奖励函数差异的残差奖励函数,然后采用残差 Q 学习(RQL)以该残差奖励函数对齐策略以符合人类偏好。在模拟和真实世界任务上的广泛评估表明,MEReQ 能够实现来自人类干预的样本高效策略对齐。

关键词

引用

@article{arxiv.2406.16258,
  title  = {MEReQ: Max-Ent Residual-Q Inverse RL for Sample-Efficient Alignment from Intervention},
  author = {Yuxin Chen and Chen Tang and Jianglan Wei and Chenran Li and Ran Tian and Xiang Zhang and Wei Zhan and Peter Stone and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:2406.16258},
  year   = {2025}
}