中文

多智能体 LLM 辩论的序列共识:Wald-SPRT 计算监控器配合校准失效检测

机器学习 2026-05-20 v1

摘要

多智能体 LLM 辩论提高了事实准确性和推理能力,但大多数配方选择固定的轮次,在简单项目上浪费计算资源,在困难项目上不足。我们将 Wald 的顺序概率比检验 (SPRT) 作为 LLM 辩论的 plug-in 计算监控器进行调整。在每个轮次之后,LLM 评判器发出该轮代理位置的 [0,1] consensus score;Wald 监控器在 Beta 概似族下的 "有用收敛" 与 "尚未有用" 的对数似然比上累积,并在到达任一边界或在 R_max 返回 capped best-effort 结果时停止。在 i.i.d. 假设下,该规则继承 SPRT type-I/type-II 错误保证;在实际部署中,校准本身是更重要的对象,因为它估计评判得分在给定领域是否真正区分有用收敛与无用收敛。我们评估两个轨道:(i) 在校准的 Beta 模型下进行蒙特卡洛研究,描述 working curves、错误率、capping 行为和灵敏度;(ii) 在 200 个尝试的 MMLU 和 200 个尝试的 GSM8K 项目上进行真实 LLM 评估,使用三个异构代理 (gpt-5, claude-opus-4-6, gemini-2.5-pro) 和 claude-opus-4-6 评判器,使用 disjoint 40 项目校准子集。在 GSM8K 上,该规则在 1.01 个平均轮次(4.06 次 LLM 调用)处停止,准确率为 97.0%,而固定 5 轮辩论为 99.0%(15 次调用):在准确率下降 2pp 的情况下,实现了 3.7 倍调用减少。在 MMLU 上,校准的 KL 几乎为 0,且该规则在 99.5% 的项目上进行 capping,每项成本降低 2.1 倍。关键在于,SPRT 并不使辩论更准确,而是作为多智能体 LLM 系统的廉价计算控制和失效检测层。

关键词

引用

@article{arxiv.2605.19193,
  title  = {Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection},
  author = {Andrea Morandi},
  journal= {arXiv preprint arXiv:2605.19193},
  year   = {2026}
}