思考与否:元训练中过量 CoT 示例的隐形成本
计算与语言
2025-12-08 v1 人工智能
机器学习
摘要
链律思维(CoT)提示结合少样本情境学习(ICL)已为大型语言模型(LLM) unlocking 了显著的推理能力。然而,当预训练知识不足时,ICL 与 CoT 示例在 novel 任务上是无效的。我们在受控环境中使用 CoT-ICL Lab 框架研究此问题,并提出用于 in-context 学习 novel 抽象推理任务的元训练技术。虽然 CoT 示例促进了推理,但我们注意到在元训练期间过度包含 CoT 示例会在 CoT 监督有限时降低性能。为缓解此行为,我们提出了 CoT-Recipe,即一种正式方法,用于调节元训练序列中 CoT 与 non-CoT 示例的混合比例。我们证明,通过 CoT-Recipe 的谨慎调制可使 transformer 在 novel 任务上的准确率提升最高可达 300%,即使在情境中没有 CoT 示例。我们通过将其应用于预训练 LLM(Qwen2.5 系列)进行符号推理任务,观察到准确率提升最高可达 130%。
关键词
引用
@article{arxiv.2512.05318,
title = {To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples},
author = {Vignesh Kothapalli and Ata Fatahibaarzi and Hamed Firooz and Maziar Sanjabi},
journal= {arXiv preprint arXiv:2512.05318},
year = {2025}
}
备注
26 pages, 45 figures, 3 tables