中文

基础阅读蒸馏

计算与语言 2025-07-31 v2

摘要

大型语言模型(LLMs)在各种自然语言处理领域展现了卓越的能力,但它们需要高昂的计算资源,这限制了其在实际中的部署。蒸馏是通过知识蒸馏或任务蒸馏解决该问题的一种技术。这两种蒸馏方法都训练小模型来模仿LLMs的特定特征,但它们都忽略了对小模型在与下游任务无关的通用文本上进行的基础阅读教育。在本文中,我们提出了基础阅读蒸馏(BRD),它教育小模型模仿LLMs在每个句子上的基础阅读行为,例如命名实体识别、提问和回答。经过这种基础教育后,我们将小模型应用于各种任务,包括语言推理基准测试和BIG-bench任务。结果表明,小模型可以超越或达到比其大20倍以上的LLMs相当的性能。分析揭示,BRD有效影响了小模型的概率分布,并且与知识蒸馏或任务蒸馏具有正交性。

关键词

引用

@article{arxiv.2507.19741,
  title  = {Basic Reading Distillation},
  author = {Zhi Zhou and Sirui Miao and Xiangyu Duan and Hao Yang and Min Zhang},
  journal= {arXiv preprint arXiv:2507.19741},
  year   = {2025}
}

备注

Accepted by ACL2025