中文

SynAdapt:通过合成连续思维链学习大语言模型中的自适应推理

计算与语言 2025-08-04 v1 人工智能

摘要

虽然思维链(CoT)推理提升了模型性能,但由于生成离散的CoT令牌(DCoT),它带来了显著的时间成本。连续CoT(CCoT)提供了一种更高效的替代方案,但现有的CCoT方法受限于间接微调、对齐有限或目标不一致。为克服这些局限,我们提出了 \textit{SynAdapt},一个创新的高效推理框架。具体来说,\textit{SynAdapt} 生成合成CCoT,作为LLM精确且有效的对齐目标。这种合成CCoT明确地引导LLM学习CCoT并直接得出准确答案。此外,仅依赖CCoT不足以解决难题。为此,\textit{SynAdapt} 集成了一个难度分类器,利用问题上下文和CCoT来识别难题。CCoT在经过一些简要推理后能有效帮助识别难题。然后,我们自适应地提示LLM重新思考这些难题以提升性能。在来自不同难度级别的多个基准上的广泛实验结果有力地证明了我们方法的有效性,实现了最佳的准确率-效率权衡。

关键词

引用

@article{arxiv.2508.00574,
  title  = {SynAdapt: Learning Adaptive Reasoning in Large Language Models via Synthetic Continuous Chain-of-Thought},
  author = {Jianwei Wang and Ziming Wu and Fuming Lai and Shaobing Lian and Ziqian Zeng},
  journal= {arXiv preprint arXiv:2508.00574},
  year   = {2025}
}