中文

前几个标记就够了:一种高效且有效的推理模型无监督前缀微调方法

计算与语言 2025-03-05 v1

摘要

提高大语言模型(LLM)的推理能力通常需要基于标注数据的监督微调或计算代价高昂的采样。我们引入了无监督前缀微调(UPFT),它利用前缀自洽性观察——即在不同求解轨迹之间共享的初始推理步骤——来增强LLM推理效率。通过仅训练初始前缀子串(最少8个标记),UPFT消除了对标注数据或穷举采样的需求。在推理基准上的实验表明,UPFT在减少75%训练时间和99%采样成本的同时,达到了拒绝采样微调等监督方法的性能。进一步分析表明,错误倾向于出现在推理过程的后期阶段,而基于前缀的训练保留了模型的结构知识。这项工作展示了最少的无监督微调如何释放LLM中大量的推理增益,提供了一种可扩展且资源高效的替代传统方法的方案。

关键词

引用

@article{arxiv.2503.02875,
  title  = {The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models},
  author = {Ke Ji and Jiahao Xu and Tian Liang and Qiuzhi Liu and Zhiwei He and Xingyu Chen and Xiaoyuan Liu and Zhijie Wang and Junying Chen and Benyou Wang and Zhaopeng Tu and Haitao Mi and Dong Yu},
  journal= {arXiv preprint arXiv:2503.02875},
  year   = {2025}
}