基于最大熵残差Q学习的逆RL:面向干预的高效对齐
机器学习
2025-03-04 v3
摘要
将机器行为与人类偏好进行对齐对于在以人类为中心的环境中部署具身AI智能体至关重要。一个有前景的解决方案是从人类干预中进行的交互式模仿学习,其中人类专家观察策略执行并提供干预作为反馈。然而,现有方法往往未能有效利用先验策略,从而阻碍了样本效率。在本工作中,我们引入了MEReQ(Maximum-Entropy Residual-Q Inverse Reinforcement Learning),旨在实现来自人类干预的样本高效对齐。MEReQ推断残差奖励函数,捕捉人类专家与先验策略底层奖励函数之间的差异,然后利用残差Q学习(RQL)通过该残差奖励函数与人类偏好进行对齐。在模拟和真实世界任务上的广泛评估表明,MEReQ实现了来自人类干预的样本高效策略对齐。
引用
@article{arxiv.2406.16257,
title = {Towards Scalable Exact Machine Unlearning Using Parameter-Efficient Fine-Tuning},
author = {Somnath Basu Roy Chowdhury and Krzysztof Choromanski and Arijit Sehanobish and Avinava Dubey and Snigdha Chaturvedi},
journal= {arXiv preprint arXiv:2406.16257},
year = {2025}
}
备注
Accepted at ICLR 2025