大语言模型测试时扩展综述:是什么、怎么做、在哪做及效果如何?
计算与语言
2025-05-06 v3 人工智能
摘要
随着预训练时代对扩展计算(数据和参数)的热情逐渐消退,测试时扩展,亦称“测试时计算”,已成为一个突出的研究热点。最近的研究表明,TTS可以进一步激发大语言模型的问题解决能力,不仅在数学和编程等专业推理任务中取得重大突破,也在开放式问答等通用任务中表现优异。然而,尽管该领域近期成果爆发式增长,仍迫切需要一篇提供系统性理解的全面综述。为填补这一空白,我们提出了一个统一的、多维度的框架,该框架围绕TTS研究的四个核心维度构建:扩展什么、如何扩展、在哪扩展以及扩展效果如何。基于该分类体系,我们对方法、应用场景和评估方面进行了广泛回顾,并给出了一个有条理的分解,突出了各项技术在更广阔的TTS图景中的独特功能角色。通过这一分析,我们提炼了TTS至今的主要发展轨迹,并为实际部署提供了实践指南。此外,我们识别了若干开放性挑战,并对有前景的未来方向提供了见解,包括进一步扩展、阐明技术的功能本质、泛化至更多任务以及更多归因分析。我们的代码库可在 https://github.com/testtimescaling/testtimescaling.github.io/ 获取。
引用
@article{arxiv.2503.24235,
title = {A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?},
author = {Qiyuan Zhang and Fuyuan Lyu and Zexu Sun and Lei Wang and Weixu Zhang and Wenyue Hua and Haolun Wu and Zhihan Guo and Yufei Wang and Niklas Muennighoff and Irwin King and Xue Liu and Chen Ma},
journal= {arXiv preprint arXiv:2503.24235},
year = {2025}
}
备注
v3: Expand Agentic and SFT Chapters. Build Website for better visualization