中文

QFFT:无问题精细调优用于自适应推理

计算与语言 2025-06-17 v1

摘要

最近的长链式思考(CoT)推理模型取得了进展,但存在过度思考问题,尤其是针对简单问题会生成冗余的推理步骤。本文重新审视了长CoT和短CoT模型的推理模式,发现短CoT模式提供简洁且高效的推理,而长CoT模式在短CoT模式难以应对的复杂场景中表现出色。为使模型能够利用两种推理模式,我们提出了无问题精细调优(QFFT),这是一种在训练时删除输入问题并仅从长CoT响应中学习的精细调优方法。该方法使模型能够自适应地采用两种推理模式:优先采用短CoT模式,当必要时激活长CoT模式。在various数学数据集上进行实验,表明QFFT将平均响应长度缩短超过50\%,同时实现了与监督式精细调优(SFT)相当的性能。此外,QFFT在噪声、域外和低资源场景中表现优于SFT。

关键词

引用

@article{arxiv.2506.12860,
  title  = {QFFT, Question-Free Fine-Tuning for Adaptive Reasoning},
  author = {Wanlong Liu and Junxiao Xu and Fei Yu and Yukang Lin and Ke Ji and Wenyu Chen and Yan Xu and Yasheng Wang and Lifeng Shang and Benyou Wang},
  journal= {arXiv preprint arXiv:2506.12860},
  year   = {2025}
}

备注

23 pages