中文

大语言模型能否通过教学学习以提升推理能力?一项初步研究

计算与语言 2024-11-26 v3 人工智能

摘要

教学改善学生模型(如知识蒸馏)是大语言模型中广泛研究的方法之一。然而,对于人类而言,教学不仅改善学生,还能提升教师,通过促进更严谨、更清晰的推理以及知识构建。我们提出:大语言模型能否通过教学学习以获得更好的推理能力?如果可以,我们可能无需依赖人工生产的数据或更强的模型,就能持续进步模型。本文提供了关于这一问题的初步探索。我们展示了教学想法可以融入现有的大语言模型训练/提示管道中,并带来改进。具体而言,我们设计了三种方法,分别模拟教学的三个层次:观察学生反馈、从反馈中学习、迭代学习,目标是提高答案准确率(无需训练)或改善模型内在能力(通过微调)。我们揭示了一些发现:(1) 使学生更易学习的教学材料,在使用基于情境学习作为学生“学习”方法时,逻辑更清晰、更准确;(2) 弱到强的泛化:教学弱模型可能有助于改进强模型;(3) 学生的多样性可能有帮助:教学多个学生可能优于教学一个学生或教师本身。我们希望我们的探索能够激发未来对教学方法的研究,并更广泛地采纳教育中的先进技术来改进大语言模型。代码和网站请访问 https://github.com/imagination-research/lbt 和 https://sites.google.com/view/llm-learning-by-teaching。

关键词

引用

@article{arxiv.2406.14629,
  title  = {Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study},
  author = {Xuefei Ning and Zifu Wang and Shiyao Li and Zinan Lin and Peiran Yao and Tianyu Fu and Matthew B. Blaschko and Guohao Dai and Huazhong Yang and Yu Wang},
  journal= {arXiv preprint arXiv:2406.14629},
  year   = {2024}
}

备注

NeurIPS 2024