基于顺序证据积累的 LLM 集团自适应共识:自动预算识别与校准提交信号
机器学习
2026-05-15 v2
摘要
大型语言模型集团可提升推理准确率,但仅提升至一定性能边界后,额外的推理反而会导致准确率下降。我们引入 DASE(Deliberative Adaptive Stopping Ensemble),这是一种用于迭代集团推理的停止策略,能够在真实共识达成时及时提交,在证据碎片化时采用全局频率后备方案。我们做出了三项贡献。(1) DASE 产生的提交类型路由划分在基准测试间具有普适性,且与语言化单调用置信度互补。在 GPQA-Extended(N=546,70B 集团)上,该划分实现了 39.5 百分点路由间隔(右墙 81.1% vs. 左墙 41.5%)。在 AIME 2010-2023(N=261,120B 集团,3 次随机种子)上,右墙提交的准确率达到 98.3%,而左墙为 72.8%(间隔 25.5 百分点),统计上等价于 Opus 4.6 标准语言化置信度在相同覆盖率下的表现(间隔 25.7 百分点;bootstrap p=0.873);两种机制在 37% 的路由分配上不一致。(2) 自适应停止,而非注入带宽,是驱动准确率的关键。在 AIME-300 上,带宽仅贡献 0.3 百分点(无统计显著性)。在 GPQA-Extended 的 120B 级别,稀疏注入(约 15 个 token/工人/轮)实现 70.9% 准确率,路由间隔 30.7 百分点;稠密注入(约 600 个字符/工人/轮)实现 72.2%,但右墙覆盖率减半,路由间隔缩窄至 18.9 百分点。(3) 注入类方法表现出准确率随推理轨迹的倒U型;此模式具有假设生成性。
引用
@article{arxiv.2605.04236,
title = {Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals},
author = {Roberto E. Medina},
journal= {arXiv preprint arXiv:2605.04236},
year = {2026}
}