通过代理值传播学习主动人类参与
人工智能
2025-02-06 v1 机器人学
摘要
主动人类参与的学习使人类主体能够在训练过程中主动介入并向 AI 智能体展示。人类的交互和纠正性反馈为学习过程带来安全性和 AI 对齐。本文提出了一种名为代理值传播(Proxy Value Propagation)的新型无奖励主动人类参与方法,用于策略优化。我们的关键洞察是,可以设计代理价值函数来表达人类意图,其中人类演示中的状态-动作对被标记为高值,而被干预的智能体动作则获得低值。通过 TD 学习框架,将演示的状态-动作对标记的值传播到智能体探索生成的其他未标记数据中。因此,代理价值函数诱导出忠实模拟人类行为的策略。人类在环实验表明,我们的方法具有普适性和效率。通过对现有强化学习算法的最小修改,本方法能够学习解决连续和离散控制任务,以及各种人类控制设备,包括在《Grand Theft Auto V》中的困难驾驶任务。Demo 视频和代码均可用:https://metadriverse.github.io/pvp
引用
@article{arxiv.2502.03369,
title = {Learning from Active Human Involvement through Proxy Value Propagation},
author = {Zhenghao Peng and Wenjie Mo and Chenda Duan and Quanyi Li and Bolei Zhou},
journal= {arXiv preprint arXiv:2502.03369},
year = {2025}
}
备注
NeurIPS 2023 Spotlight. Project page: https://metadriverse.github.io/pvp