T1:工具集成自我验证用于小型语言模型的测试时间计算扩展
计算与语言
2025-04-08 v1 人工智能
摘要
最近的研究表明,测试时间计算扩展有效提高了小型语言模型(sLMs)的性能。然而,先前的研究主要考察了使用额外的大型模型作为验证器的测试时间计算扩展,留下了sLMs 自我验证的探索不足。在本工作中,我们调查了sLMs 在测试时间扩展下的自我验证能力。我们发现,即使通过大型验证器进行知识蒸馏,sLMs 在需要记忆的验证任务(如数值计算和事实核查)方面仍难以实现可靠的自我验证。为解决这一局限性,我们提出工具集成自我验证(T1),将记忆密集型验证步骤委托给外部工具(如代码解释器)。我们的理论分析表明,工具集成减少了记忆需求并提高了测试时间计算扩展性能。在 MATH 基准测试中,T1 使 1B 参数的 Llama-3.2 模型在测试时间扩展下超过了显著更大的 Llama-3.1 8B 模型。此外,T1 在数学(MATH500)和多领域知识密集型任务(MMLU-Pro)上具有良好的可迁移性。我们的发现凸显了工具集成在显著提升 sLMs 自我验证能力方面的潜力。
引用
@article{arxiv.2504.04718,
title = {T1: Tool-integrated Self-verification for Test-time Compute Scaling in Small Language Models},
author = {Minki Kang and Jongwon Jeong and Jaewoong Cho},
journal= {arXiv preprint arXiv:2504.04718},
year = {2025}
}
备注
Preprint