中文

思考与否:元训练中过量 CoT 示例的隐形成本

计算与语言 2025-12-08 v1 人工智能 机器学习

摘要

链律思维(CoT)提示结合少样本情境学习(ICL)已为大型语言模型(LLM) unlocking 了显著的推理能力。然而,当预训练知识不足时,ICL 与 CoT 示例在 novel 任务上是无效的。我们在受控环境中使用 CoT-ICL Lab 框架研究此问题,并提出用于 in-context 学习 novel 抽象推理任务的元训练技术。虽然 CoT 示例促进了推理,但我们注意到在元训练期间过度包含 CoT 示例会在 CoT 监督有限时降低性能。为缓解此行为,我们提出了 CoT-Recipe,即一种正式方法,用于调节元训练序列中 CoT 与 non-CoT 示例的混合比例。我们证明,通过 CoT-Recipe 的谨慎调制可使 transformer 在 novel 任务上的准确率提升最高可达 300%,即使在情境中没有 CoT 示例。我们通过将其应用于预训练 LLM(Qwen2.5 系列)进行符号推理任务,观察到准确率提升最高可达 130%。

关键词

引用

@article{arxiv.2512.05318,
  title  = {To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples},
  author = {Vignesh Kothapalli and Ata Fatahibaarzi and Hamed Firooz and Maziar Sanjabi},
  journal= {arXiv preprint arXiv:2512.05318},
  year   = {2025}
}

备注

26 pages, 45 figures, 3 tables