ARBITER:测试时抽样中的推理轨迹流域与多数投票失效
机器学习
2026-05-27 v1
摘要
当语言模型使用测试时抽样时,他们会生成多个推理轨迹并通过多数投票选择答案。我们展示,这些轨迹并非独立:对于给定问题,他们聚集到少数几个簇中,或推理流域,每个流域由归一化最终答案及抵达该答案的解决方案定义。因此,多数投票选择最稳定的流域而非最准确的流域,这导致正确答案虽存在但被淘汰的错误多数投票失效。我们引入 ARBITER,一种模型中性方法,仅使用基础模型的自身抽样输出、隐藏状态和派生证据来建模流域之间的相互作用。大多数直接纠正策略都失败了;ARBITER 采用保守的加性证据叠加在共识之上。在最简单的无参数形式中,ARBITER-Δ 将相同模型的证据添加到多数先验之上,而 ARBITER-Enc 则通过完整解决方案的隐藏状态增强此项。 在 GSM8K 上使用 Qwen3-4B 时,K=24 个样本的共识实现约 94% 区间的准确率,而同一池中位于前 2 的预测实现约 96% 区间。ARBITER 通过零外部信息恢复了此类案例的一部分。在三个模型家族和三个数学基准中,它一致获得提升且无净负案例;例如,在 Llama-3.1-8B 的 MMLU-HS-Math 上,它将准确率从约中 78% 提升至约中 82%,恢复了约 22% 的可用先机余量,表明此先机余量可从样本池本身部分恢复。
引用
@article{arxiv.2605.26172,
title = {ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling},
author = {Meng Cai and Lars Kulik and Farhana Choudhury},
journal= {arXiv preprint arXiv:2605.26172},
year = {2026}
}
备注
Preprint. 34 pages, 2 figures