中文

别让 LLM 去读图:让图去想

人工智能 2026-04-28 v1

摘要

我们探讨了显式信念图是否能提高LLM在合作多智能体推理中的性能。通过在四个LLM模型家族中进行3000多次受控实验,我们确立了四项发现。首先,集成架构决定了信念图是否提供价值:作为提示上下文,图对强模型而言是装饰性的,仅对弱模型在2阶理论心智(Theory of Mind)任务中有益(80% vs 10%, p<0.0001, OR=36.0);当图通过排序短列表门控动作选择时,即使对强模型也变得结构性必需(100% vs 20% on 2nd-order ToM, p<0.001)。其次,我们识别了一种“计划违背”(Planner Defiance)现象,即模型家族特定的失败模式,在部分能力水平下,LLM会偏离正确的计划建议(90% 覆盖率,复制实验N=20);Gemini模型几乎没有违背,而Llama 70B显示90%违背,模型区分事实上下文(被动)和建议性建议(被覆盖)。第三,完整游戏证据确认中代理惯例(+128% 超基线,p=0.003)优于所有单智能体干预,而 individual belief-graph 组件必须组合才能产生提升。第四,初步的规模分析(N=10/单元格,探索性)表明图的深度存在边际递减:浅层图提供最佳性价比比率,而更深的ToM图在更大玩家数量下反而有害(5人游戏中-1.5分,p=0.029)。

关键词

引用

@article{arxiv.2604.23057,
  title  = {Don't Make the LLM Read the Graph: Make the Graph Think},
  author = {Yuqi Sun and Tianqin Meng and George Liu and Yashraj Panwar and Lakshya Chaudhry and Munasib Ilham and Aman Chadha},
  journal= {arXiv preprint arXiv:2604.23057},
  year   = {2026}
}

备注

main body has 9 pages, 4 figures, under review for COLM 2026 conference