LLM 推理综合评估:从单模型到多智能体范式
机器学习
2026-01-21 v1
摘要
大型语言模型 (LLMs) 正在日益被用作推理系统,其中推理范式(如链式思考 CoT 和多智能体系统 MAS)在起关键作用,但它们的相对有效性和成本-精度权衡仍不明确。在本工作中,我们对推理范式进行全面统一的评估,涵盖直接单模型生成、CoT 增强的单模型推理以及代表性 MAS 工作流程,在多样化的封闭形式基准上表征其推理性能。除了整体性能,我们使用针对性角色隔离分析探讨 MAS 中的角色特定能力需求,对成本-精度权衡进行分析,以识别哪些 MAS 工作流程在成本和精度之间提供有利平衡,哪些则因开销过高而在收益微小方面付出代价。我们进一步引入 MIMeBench,一个新的开放式基准,旨在针对两个基础且鲜有探索的语义能力——语义抽象和对比式判别——提供替代评估轴,进而实现超越封闭形式精度和启发式能力细粒度评估,这是现有基准难以捕捉的。我们的结果表明,结构复杂性的增加并不一致地导致推理性能提升,其收益对推理范式的属性和适合性高度依赖。代码已发布于 https://gitcode.com/HIT1920/OpenLLMBench 上。
引用
@article{arxiv.2601.13243,
title = {A Comprehensive Evaluation of LLM Reasoning: From Single-Model to Multi-Agent Paradigms},
author = {Yapeng Li and Jiakuo Yu and Zhixin Liu and Xinnan Liu and Jing Yu and Songze Li and Tonghua Su},
journal= {arXiv preprint arXiv:2601.13243},
year = {2026}
}