中文

多智能体是否优于单智能体?评估用于图解几何问题解答与推理的智能体框架

人工智能 2025-12-19 v1 计算几何

摘要

图解几何问题解答是多模态大语言模型(MLLM)的关键基准测试,但多智能体设计相较于单智能体的优势尚不明确。我们系统比较了单智能体与多智能体管线在四个视觉数学基准测试上的表现:Geometry3K、MathVerse、OlympiadBench 和 We-Math。对于开源模型,多智能体 consistently 能提升性能。例如,Qwen-2.5-VL(7B)在 Geometry3K 上提升 6.8 分,Qwen-2.5-VL(32B)提升 3.3 分,两个 Qwen-2.5-VL 变体在 OlympiadBench 和 We-Math 上均取得进一步提升。相比之下,闭源模型 Gemini-2.0-Flash 在经典基准测试中通常以单智能体模式表现更好,而在较新的 We-Math 数据集上,多智能体仅带来有限的改进。这些发现表明,多智能体管线为开源模型提供了明确的优势,能够在较新、较不熟悉的基准测试中辅助强大的专有系统,但智能体分解并非在所有情况下都是最优方案。所有代码、数据和推理文件均可在 https://github.com/faiyazabdullah/Interpreter-Solver 获取。

关键词

引用

@article{arxiv.2512.16698,
  title  = {Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning},
  author = {Mahbub E Sobhani and Md. Faiyaz Abdullah Sayeedi and Mohammad Nehad Alam and Proma Hossain Progga and Swakkhar Shatabda},
  journal= {arXiv preprint arXiv:2512.16698},
  year   = {2025}
}

备注

Accepted to the ARR October 2025 cycle