中文

谁在帮助谁?分析相互依赖以评估人类AI协作中的合作

多智能体系统 2026-01-21 v3 人工智能

摘要

面向人类AI协作和零样本合作的最新方法专注于完成任务,即以任务奖励作为唯一的评估指标,而对两位代理人如何相互合作则不予关注。此外,主观的用户研究仅提供关于团队中合作质量的有限见解。具体而言,我们关注当训练好的代理人与人类配对时,团队中出现的合作行为——这一问题被现有文献所忽视。为正式解决此问题,我们提出了建设性相互依赖的概念——即衡量代理人如何依赖彼此的动作来实现共享目标——作为评估人类-代理人团队合作的关键指标。我们以STRIPS形式解释相互依赖,并定义度量标准以评估代理人动作之间的依赖程度。我们将最先进的代理人HAT与学习的人类模型以及人类参与者配对,在流行的Overcooked领域进行用户研究,对这些人类-代理人团队进行任务奖励和团队绩效评估。我们的结果表明,尽管训练好的代理人实现了高任务奖励,但它们未能诱导合作行为,显示出团队中极低的相互依赖水平。此外,我们的分析揭示了团队绩效不一定与任务奖励相关,这凸显了任务奖励alone无法可靠地衡量团队中出现的合作。

关键词

引用

@article{arxiv.2502.06976,
  title  = {Who is Helping Whom? Analyzing Inter-dependencies to Evaluate Cooperation in Human-AI Teaming},
  author = {Upasana Biswas and Vardhan Palod and Siddhant Bhambri and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2502.06976},
  year   = {2026}
}