中文

大语言模型是推理教师

计算与语言 2023-06-14 v2 人工智能 机器学习

摘要

近期工作表明,思维链(CoT)提示可引导语言模型逐步解决复杂推理任务。然而,基于提示的 CoT 方法依赖于如 GPT-3 175B 等非常大的模型,其大规模部署代价高昂。在本文中,我们利用这些大模型作为推理教师,使更小模型具备复杂推理能力,并将模型规模要求降低数个数量级。我们提出 Fine-tune-CoT,一种从超大教师模型生成推理样本以微调更小模型的方法。我们在广泛的公开模型与复杂任务上评估了该方法。我们发现 Fine-tune-CoT 能在小模型中实现显著的推理能力,远超基于提示的基线,甚至在多数任务中超过教师模型。此外,我们通过利用教师模型为每个原始样本生成多个不同推理依据来扩展该方法。以此类多样化推理丰富微调数据,可在各数据集上带来大幅性能提升,即便对极小的模型亦然。我们进行了消融与样本研究以理解学生模型推理能力的涌现。我们的代码实现与数据可在 https://github.com/itsnamgyu/reasoning-teacher 获取。

关键词

引用

@article{arxiv.2212.10071,
  title  = {Large Language Models Are Reasoning Teachers},
  author = {Namgyu Ho and Laura Schmid and Se-Young Yun},
  journal= {arXiv preprint arXiv:2212.10071},
  year   = {2023}
}

备注

ACL 2023 camera-ready