中文

CoRefine:基于置信度引导的自适应测试时计算自我完善

量子物理 2026-02-10 v1

摘要

大型语言模型(LLM)通常通过并行解码(例如,512个样本)进行测试时扩展以提高推理准确性,但计算成本高昂。我们引入CoRefine,这是一种基于置信度引导的自我完善方法,通过轻量级211k参数的Conv1D控制器 atop 冻结的LLM 实现了与并行方法相当的准确性,同时显著降低token数。控制器消耗完整轨迹的置信度,以决定是停止、重新检查还是尝试不同方法,从而实现针对性的自我纠正,每道问题平均进行2.7次完善,相对于512样本基线大约减少190倍的token使用。在多样化的推理基准测试中,控制器在自信停止时达到92.6%的精确率,表明置信度动力学可靠地指示正确性而无需真实答案验证。我们将其扩展为CoRefine-Tree,一种混合顺序-并行变体,能够自适应地平衡探索与开发,易于部署且兼容验证器。通过将置信度视为控制信号而非正确性保证,CoRefine为可扩展的推理和具有 imperfect 验证器的智能体设置提供了一个模块化的基本要素。

关键词

引用

@article{arxiv.2602.08947,
  title  = {Long distance quantum illumination and ranging using polarization entangled photon pairs in a lossy environment},
  author = {Sujai Matta and Soumya Asokan and Sanchari Chakraborti and Mayank Joshi and Rahul Dalal and C. M. Chandrashekar},
  journal= {arXiv preprint arXiv:2602.08947},
  year   = {2026}
}

备注

9 pages, 7 figures, 38 references