理论物理中的测试时缩放技术——基于TPBench数据集的方法比较
机器学习
2025-06-27 v1 宇宙学与河外天体物理
人工智能
高能物理 - 唯象学
高能物理 - 理论
摘要
大型语言模型(LLM)在复杂推理方面展现出强大能力,而测试时缩放技术能够以相对较低的成本提升其性能。许多此类方法已在AIME等数学推理基准上得到开发和评估。本文研究从这些基准中获得的经验教训是否能推广到高级理论物理领域。我们在TPBench物理数据集上评估了一系列常见的测试时缩放方法,并将其效果与在AIME上的结果进行比较。为了更好地利用物理问题的结构,我们开发了一种新颖的符号弱验证器框架,以改进并行缩放结果。我们的实证结果表明,该方法在TPBench上显著优于现有的测试时缩放方法。我们还在AIME上评估了该方法,证实了其在解决高级数学问题方面的有效性。我们的发现强调了逐步符号验证在解决复杂科学问题中的强大作用。
引用
@article{arxiv.2506.20729,
title = {Test-time Scaling Techniques in Theoretical Physics -- A Comparison of Methods on the TPBench Dataset},
author = {Zhiqi Gao and Tianyi Li and Yurii Kvasiuk and Sai Chaitanya Tadepalli and Maja Rudolph and Daniel J. H. Chung and Frederic Sala and Moritz Münchmeyer},
journal= {arXiv preprint arXiv:2506.20729},
year = {2025}
}
备注
23 pages, 6 figures