CRAFT:基于部分信息的多智能体协调基准
计算与语言
2026-04-29 v2 人工智能
摘要
我们介绍CRAFT,这是一个用于评估大语言模型在严格部分信息下的实用性通信的多智能体基准。在这种设置下,多个具有互补但不完整视图的智能体必须通过自然语言协调,以构建一个共享的3D结构,而没有单个智能体能够完全观察该结构。我们将这个问题形式化为多发送方受限实用性说话人问题,并提供一个诊断框架,将失败分解为空间 grounding、信念建模和实用性通信错误,包括对前沿和开放权重模型中行为失败轮廓的分类。对于 diverse 的模型,包括8个开源权重模型和7个包括推理模型的前沿模型,我们发现更强的推理能力并不一定转化为更好的协调:较小的开源权重模型有时会匹配或超越前沿系统,改进的个人沟通并不保证成功的合作。这些结果表明,多智能体协调仍然是一个根本性未解决的挑战。我们的代码可在 https://github.com/csu-signal/CRAFT 查看。
引用
@article{arxiv.2603.25268,
title = {CRAFT: Grounded Multi-Agent Coordination Under Partial Information},
author = {Abhijnan Nath and Hannah VanderHoeven and Nikhil Krishnaswamy},
journal= {arXiv preprint arXiv:2603.25268},
year = {2026}
}
备注
Added revisions, corrected typos and additional analysis