中文

临时人类-AI 协调挑战

人工智能 2025-07-01 v2 人机交互 多智能体系统

摘要

实现 AI 代理与人类之间的无缝协调对于实际应用至关重要,但仍是一个显著的开放性挑战。汉娜比是一款合作式卡牌游戏,具有不完全信息、受限沟通、需要理论心智(Theory of Mind)以及协同行动——这使其成为人类-AI 协调的理想测试平台。然而,其在人类-AI 交互中的应用受限于人类评估的挑战。本文引入临时人类-AI 协调挑战(Ad-Hoc Human-AI Coordination Challenge, AH2AC2),以克服昂贵且难以复现的人类评估限制。我们在大规模人类数据集上开发了“人类代理代理”(human proxy agents),作为 AH2AC2 中稳健、低成本且可复现的人类风格评估合作伙伴。为鼓励开发数据高效的方法,我们开源了一个包含 3,079 场游戏的数据集,刻意限制可用人类游戏数据的数量。我们呈现两种两人和三人汉娜比情景的基准结果。为确保公平评估,我们通过受控评估系统托管代理代理,而非公开发布。代码地址为 \href{https://github.com/FLAIROx/ah2ac2}{https://github.com/FLAIROx/ah2ac2}。

关键词

引用

@article{arxiv.2506.21490,
  title  = {Ad-Hoc Human-AI Coordination Challenge},
  author = {Tin Dizdarević and Ravi Hammond and Tobias Gessler and Anisoara Calinescu and Jonathan Cook and Matteo Gallici and Andrei Lupu and Darius Muglich and Johannes Forkel and Jakob Nicolaus Foerster},
  journal= {arXiv preprint arXiv:2506.21490},
  year   = {2025}
}

备注

Published at ICML 2025