中文

通过引导式强化自训练提升语言模型搜索能力

高能物理 - 实验 2024-10-07 v1 仪器与探测器

摘要

尽管语言模型在广泛的任务上显示出卓越的性能,但在复杂推理场景中仍面临挑战。最近的研究表明,针对线性化搜索痕迹(即解决方案的搜索路径)进行训练的语言模型,比仅针对最终解决方案进行训练的模型在泛化能力上表现更好,尽管这些搜索痕迹可能噪声较大或次优。在此基础上,依赖此类不完美痕迹会导致测试时计算资源的低效利用。为此,我们提出了引导式强化自训练(Guided-ReST),一种旨在提高模型在推理期间有效搜索能力的微调算法。Guided-ReST的关键思想是,最优解决方案可作为模型搜索过程中的有价值逐步标记。基于此思想,我们引入一种新的数据生成方法,将最优解决方案自然地整合到模型的搜索过程中,实现高质量搜索痕迹的生成。通过对这些搜索痕迹进行微调,我们有效地将改进的搜索策略蒸馏到模型中。我们的方法在算术推理和代码自修复任务上显著提升了语言模型的搜索能力,包括Countdown、CodeContests和CodeForces。我们在https://github.com/snu-mllab/guided-rest发布了源代码。

关键词

引用

@article{arxiv.2410.02991,
  title  = {Real-time Position Reconstruction for the KamLAND-Zen Experiment using Hardware-AI Co-design},
  author = {Alexander Migala and Eugene Ku and Zepeng Li and Aobo Li},
  journal= {arXiv preprint arXiv:2410.02991},
  year   = {2024}
}