利用人类反馈强化学习改进多模态交互智能体
机器学习
2022-11-22 v1 人机交互
多智能体系统
摘要
人工智能的一个重要目标是创造既能自然与人类交互又能从反馈中学习的智能体。本文展示了如何利用人类反馈强化学习(RLHF)来改进通过模仿学习训练至基础能力水平的模拟具身智能体。首先,我们收集了人类在模拟三维世界中与智能体交互的数据。随后,我们请标注者记录他们认为智能体朝人类指示目标前进或偏离的时刻。利用这些标注数据,我们采用一种称为“跨时间 Bradley-Terry”(IBT)建模的新方法来构建捕捉人类判断的奖励模型。经优化 IBT 奖励模型所给出奖励的智能体在我们所有指标上均有所提升,包括在与智能体实时交互中的后续人类判断。总之,我们的结果展示了如何成功利用人类判断来改进智能体行为,使我们能在无程序化奖励函数的复杂具身领域中运用强化学习。智能体行为视频见 https://youtu.be/v_Z9F2_eKk4。
引用
@article{arxiv.2211.11602,
title = {Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback},
author = {Josh Abramson and Arun Ahuja and Federico Carnevale and Petko Georgiev and Alex Goldin and Alden Hung and Jessica Landon and Jirka Lhotka and Timothy Lillicrap and Alistair Muldal and George Powell and Adam Santoro and Guy Scully and Sanjana Srivastava and Tamara von Glehn and Greg Wayne and Nathaniel Wong and Chen Yan and Rui Zhu},
journal= {arXiv preprint arXiv:2211.11602},
year = {2022}
}