通过委员会学习:基于同行评审的混合教师知识蒸馏
计算与语言
2025-05-21 v4 人工智能
摘要
尽管推理能力通常在拥有数十亿参数的大型语言模型(LLMs)中才能显现,但近期研究聚焦于通过从商业 LLMs 进行知识蒸馏(KD)来改进较小的开源模型。然而,这些研究仅依赖单一 LLM 的响应作为金标准理由,而人类学习过程天然地涉及理解正确答案以及错误原因背后的理由。在本文中,我们引入一种新颖的方法——基于同行评审的 Fault-Aware DistIllation(FAIR):1)不仅仅获取教师的理由,我们的方法要求教师识别并解释学生的错误,提供定制化的指令学习数据;2)我们设计了一个模拟的同行评审过程 between teacher LLMs,并仅选择超过接受阈值的生成理由,这减少了教师在理由错误却正确猜测答案的可能性,从而提高指令学习数据的质量。针对数学、常识和逻辑推理任务进行的全面实验与分析表明,我们的方法有效。我们的代码已公开:https://github.com/zhuochunli/Learn-from-Committee。
引用
@article{arxiv.2410.03663,
title = {Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Review},
author = {Zhuochun Li and Yuelyu Ji and Rui Meng and Daqing He},
journal= {arXiv preprint arXiv:2410.03663},
year = {2025}
}
备注
16 pages, 5 figures