中文

基于自确定性的超大规模语言模型可扩展Best-of-N选择

计算与语言 2025-12-15 v3 人工智能 机器学习

摘要

Best-of-N选择是通过增加测试时计算来提升大规模语言模型(LLM)推理性能的关键技术。目前最先进的方法通常采用计算密集的奖励模型来进行响应评估和选择。像自一致性和通用自一致性这样的无奖励替代方案,在处理开放式生成任务或有效扩展方面能力有限。为解决这些局限性,我们提出了自确定性(self-certainty),一种利用LLM输出固有概率分布来估计响应质量的新颖高效指标,无需外部奖励模型。我们假设,在多个样本上聚合的更高分布自确定性与改进的响应准确性相关,因为它反映了生成输出中更大的置信度。通过在各种推理任务上的广泛实验,我们证明了自确定性:(1) 像奖励模型一样随样本量N有效扩展,但没有计算开销;(2) 补充思维链,在贪婪解码之外提升推理性能;(3) 泛化到传统自一致性方法无法处理的开放式任务。我们的发现确立了自确定性作为提升LLM推理能力的实用高效方法。代码可在 https://github.com/backprop07/Self-Certainty 获取。

关键词

引用

@article{arxiv.2502.18581,
  title  = {Scalable Best-of-N Selection for Large Language Models via Self-Certainty},
  author = {Zhewei Kang and Xuandong Zhao and Dawn Song},
  journal= {arXiv preprint arXiv:2502.18581},
  year   = {2025}
}

备注

NeurIPS 2025