中等规模语言模型中多跳情境推理的扩展趋势
人工智能
2026-01-09 v1 机器学习
摘要
我们对大型语言模型中的多跳情境推理进行受控研究,提供了任务-方法解耦的清晰证明:基于规则的模式匹配在结构化信息检索中实现 100% 成功率,但仅在需要跨文档推理的任务中达到 6.7%;而 LLM 基于的多智能体系统呈相反模式,在基于规则方法失败的推理任务中实现最高可达 80%。使用包含 120 项试验的合成评估框架(涵盖 LLaMA-3 8B、LLaMA-2 13B、Mixtral 8x7B、DeepSeek-V2 16B 四个模型),我们报告了三个关键发现:(1)多智能体放大效应取决于基础能力:仅针对具有足够推理能力的模型(LLaMA-3 8B p < 0.001,Mixtral p = 0.014)才出现统计显著的提升,提升最高可达 46.7 个百分点,而较弱的模型则未获益,表明是放大而非补偿;(2)活跃参数预测推理性能:Mixtral 的性能与其约 12B 活跃参数而非 47B 总参数相吻合,与推理时计算驱动 MoE 架构推理能力的假设相符;(3)架构质量 matters:LLaMA-3 8B 在参数更少的情况下超越 LLaMA-2 13B,符合已知的训练改进。我们的结果为关于多智能体协调和 MoE 扩展直觉提供了受控的定量证据,同时突显了多智能体效益对基础模型能力的依赖性。我们发布评估框架以支持中等规模模型推理领域的可重复研究。
引用
@article{arxiv.2601.04254,
title = {Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models},
author = {Brady Steele and Micah Katz},
journal= {arXiv preprint arXiv:2601.04254},
year = {2026}
}
备注
18 pages, 6 figures, 8 tables