符号思维链蒸馏:小模型亦能“逐步思考”
计算与语言
2024-04-17 v2
摘要
思维链提示(例如“让我们逐步思考”)引导大语言模型将其预测的理由用语言表述出来。虽然思维链可带来显著的性能提升,但其益处似乎仅在足够大的模型(超过 500 亿参数)上才显现。我们展示了数量级更小的模型(1.25 亿至 13 亿参数)仍能从思维链提示中获益。为此,我们引入符号思维链蒸馏(SCoTD),一种在从显著更大的教师模型采样的理由上训练较小学生模型的方法。在多个常识基准上的实验表明:1)SCoTD 在有监督和少样本设置下均提升了学生模型性能,尤其在挑战集上;2)从教师为每个实例采样多条推理链至关重要;3)蒸馏后,尽管参数少数个数量级,学生思维链被人类判定为与教师相当。我们测试了关于思维链样本哪些属性重要的若干假设,例如多样性 vs. 教师似然 vs. 开放性。我们发布了思维链样本语料与代码。
引用
@article{arxiv.2306.14050,
title = {Symbolic Chain-of-Thought Distillation: Small Models Can Also "Think" Step-by-Step},
author = {Liunian Harold Li and Jack Hessel and Youngjae Yu and Xiang Ren and Kai-Wei Chang and Yejin Choi},
journal= {arXiv preprint arXiv:2306.14050},
year = {2024}
}
备注
ACL 2023