DART:基于多智能体不一致性用于多模态推理中的工具招募
计算与语言
2025-12-09 v1 人工智能
计算机视觉与模式识别
摘要
专业化视觉工具可增强大语言模型或视觉语言模型,注入专家知识(如 grounding、空间推理、医学知识等),但确定何时调用哪些工具(以及如何调用)常常具有挑战性。我们介绍 DART,一个多智能体框架,通过多个辩论视觉智能体之间的不一致性来识别有用的视觉工具(如目标检测、OCR、空间推理等),以解决智能体间的不一致问题。这些工具通过引入新信息,实现了富有成效的多智能体讨论,并通过提供工具对齐的一致性评分来突出与专家工具一致的智能体,从而促进讨论。我们利用聚合器智能体通过提供智能体输出和工具信息来选择最佳答案。我们在四个多样化基准测试上测试 DART,显示出我们的方法在多智能体辩论以及单一智能体工具调用框架方面均有显著提升,分别在 A-OKVQA 和 MMMU 上分别超过下一个最强基线(多智能体辩论配合判官模型)分别提升了 3.4% 和 2.4%。我们还发现 DART 在应用领域中对新工具适应性良好,在 M3D 医疗数据集上相较于其他强大的单智能体和多智能体基线提升了 1.3%。此外,我们测量了跨轮次的文本重叠,以突出 DART 与现有多智能体方法之间丰富讨论的差异。最后,我们研究了工具调用分布,发现多样化的工具可靠地用于帮助解决不一致问题。
引用
@article{arxiv.2512.07132,
title = {DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning},
author = {Nithin Sivakumaran and Justin Chih-Yao Chen and David Wan and Yue Zhang and Jaehong Yoon and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2512.07132},
year = {2025}
}
备注
Code: https://github.com/nsivaku/dart