中文

探究 CoT 增强蒸馏的谜团

计算与语言 2024-10-01 v2

摘要

引导“链条思维”(CoT) 论证——传递“推理”过程的 token 序列——已被证明在问答等任务中一致性地提升 LLM 的性能。更近期的工作表明,这些论证也可用于模型蒸馏:在微调小型学生模型时,除目标标签外加入 CoT 序列(从大型“教师”模型中提取),可获得(通常是显著的)提升。在本工作中,我们提出:为何及如何导致额外的训练信号有助于模型蒸馏?我们进行消融实验以探究这一问题,并报告一些可能令人惊讶的结果。具体而言:(1) 将 CoT 序列置于标签之后(而非之前)可实现更一致的下游性能——这意味着在测试时无需学生模型进行“推理”即可实现提升。(2) 就此方式而言,论证无需是连贯的推理序列即可带来提升;性能对 CoT token 的置换具有稳健性。事实上,(3) 仅少量关键 token 即可实现与使用完整论证时相同的提升效果。

关键词

引用

@article{arxiv.2406.14511,
  title  = {Investigating Mysteries of CoT-Augmented Distillation},
  author = {Somin Wadhwa and Silvio Amir and Byron C. Wallace},
  journal= {arXiv preprint arXiv:2406.14511},
  year   = {2024}
}

备注

Accepted to EMNLP 2024