AssistanceZero:可扩展解决帮助游戏
人工智能
2025-06-13 v2 机器学习
摘要
帮助游戏是一种值得期待的强化学习从人类反馈(RLHF)训练 AI 助手的替代方法。帮助游戏通过显式建模助手与用户之间的交互作为两个玩家的游戏,其中助手无法观察其共享目标,从而解决 RLHF 的关键缺陷,如欺骗行为动机。尽管存在潜力,但帮助游戏仅在简单环境中得到探索。将其扩展到更复杂的环境很难,因为这需要同时解决不确定性下的难以计算的决策问题并准确建模人类用户的行为。我们提出了解决帮助游戏的第一个可扩展方法,并将其应用于一个新的、具有挑战性的基于 Minecraft 的帮助游戏,其中包含超过 个可能的目标。我们的做法是将 AlphaZero 与一个预测人类动作和奖励的神经网络相结合,从而在不确定性下进行规划。我们展示了 AssistanceZero 在基于 Minecraft 的帮助游戏中超越基于模型的强化学习算法和模仿学习的性能。在人类研究中,我们的 AssistanceZero 训练的助手显著减少了参与者完成 Minecraft 中建造任务所需的动作数量。我们的结果表明,帮助游戏是一个可行的框架,可用于在复杂环境中训练有效的 AI 助手。我们的代码和模型可在 https://github.com/cassidylaidlaw/minecraft-building-assistance-game 上获取。
引用
@article{arxiv.2504.07091,
title = {AssistanceZero: Scalably Solving Assistance Games},
author = {Cassidy Laidlaw and Eli Bronstein and Timothy Guo and Dylan Feng and Lukas Berglund and Justin Svegliato and Stuart Russell and Anca Dragan},
journal= {arXiv preprint arXiv:2504.07091},
year = {2025}
}
备注
Presented at ICML 2025