采样多样性对 LLM 推理扩展的影响
机器学习
2025-12-22 v4
摘要
大语言模型(LLM)的扩展推理是释放更大性能的关键,而利用多样性已被证明是增强推理的有效方式。受解准确率与有意义响应多样性之间观察到的关系的启发,我们系统地研究了提示多样性对扩展推理的影响。我们从理论上解释了为什么多样化采样能改善 Best-of-N 扩展,表明经过 Best-of-N 选择后由多样化提示生成的响应的错误率显著低于由固定提示生成的响应。在此分析基础上,我们推导出一个多样性-保真度权衡原则,用于指导引入多样性的采样策略设计。基于此指导,我们实现了一系列有效的扰动风格。我们从理论和实证上刻画了多样化探索何时仍然有效,证明其在多种条件下均有效,并进一步表明在多数投票下多样性可能消失。最后,我们系统地评估了采样多样性有多有效,并表明当在不同情境中恰当地应用时,它在推理任务的 EM@100 上实现了 10.8% 的相对提升、在数学任务上实现了 9.6% 的提升、在代码生成任务的 Pass@100 上实现了 9.5% 的提升。总体而言,这项工作提供了系统分析,为理解采样多样性如何影响 LLM 推理时扩展提供了理论和实证基础。
引用
@article{arxiv.2502.11027,
title = {On the Effect of Sampling Diversity in Scaling LLM Inference},
author = {Tianchun Wang and Zichuan Liu and Yuanzhou Chen and Jonathan Light and Weiyang Liu and Haifeng Chen and Xiang Zhang and Wei Cheng},
journal= {arXiv preprint arXiv:2502.11027},
year = {2025}
}
备注
33 pages