中文

面向链式思维监督的VCORE:可变控制优化再加权

计算与语言 2026-04-21 v2 人工智能

摘要

对链式思维(CoT)轨迹进行监督式微调(SFT)已成为增强大型语言模型(LLM)推理能力的关键技术。然而,标准交叉熵损失对所有标记相等对待,忽略了其在推理轨迹中异构的贡献。这种均衡处理导致监督分配不当,尤其在复杂的长程推理任务中表现出较弱的泛化。为此,我们提出一种称为 \textbf{V}ariance-\textbf{C}ontrolled \textbf{O}ptimization-based \textbf{RE}weighting(VCORE)的框架,将CoT监督重新表述为约束优化问题。通过采用优化理论视角,VCORE 实现了对标记之间监督分配的原则性和自适应方式,从而更贴近稳健推理泛化的目标。实证评估表明,VCORE 在整体平均性能方面实现了最强水平,尤其在资源较小的模型上效果尤为明显。在域内和域外设置中,VCORE 在数学和编码基准测试中均实现了显著的性能提升,所用模型包括来自 Qwen3 系列(4B, 8B, 32B)和 LLaMA-3.1-8B-Instruct。此外,我们展示了 VCORE 作为后续强化学习的更有效初始化,为推进 LLM 推理能力的发展奠定了更坚实的基础。代码将发布于 https://github.com/coder-gx/VCORE。

关键词

引用

@article{arxiv.2510.27462,
  title  = {VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision},
  author = {Xuan Gong and Senmiao Wang and Hanbo Huang and Ruoyu Sun and Shiyu Liang},
  journal= {arXiv preprint arXiv:2510.27462},
  year   = {2026}
}

备注

Accepted to ACL2026 Main Conference