QFFT:无问题精细调优用于自适应推理
计算与语言
2025-06-17 v1
摘要
最近的长链式思考(CoT)推理模型取得了进展,但存在过度思考问题,尤其是针对简单问题会生成冗余的推理步骤。本文重新审视了长CoT和短CoT模型的推理模式,发现短CoT模式提供简洁且高效的推理,而长CoT模式在短CoT模式难以应对的复杂场景中表现出色。为使模型能够利用两种推理模式,我们提出了无问题精细调优(QFFT),这是一种在训练时删除输入问题并仅从长CoT响应中学习的精细调优方法。该方法使模型能够自适应地采用两种推理模式:优先采用短CoT模式,当必要时激活长CoT模式。在various数学数据集上进行实验,表明QFFT将平均响应长度缩短超过50\%,同时实现了与监督式精细调优(SFT)相当的性能。此外,QFFT在噪声、域外和低资源场景中表现优于SFT。
引用
@article{arxiv.2506.12860,
title = {QFFT, Question-Free Fine-Tuning for Adaptive Reasoning},
author = {Wanlong Liu and Junxiao Xu and Fei Yu and Yukang Lin and Ke Ji and Wenyu Chen and Yan Xu and Yasheng Wang and Lifeng Shang and Benyou Wang},
journal= {arXiv preprint arXiv:2506.12860},
year = {2025}
}
备注
23 pages