中文

蜂蜜,我缩小了语言模型:知识蒸馏方法对性能与可解释性的影响

计算与语言 2025-04-23 v1

摘要

人工智能(AI)日益影响现代社会,尤其在大型语言模型(LLM)方面取得了显著进展。然而,LLM的高计算和存储需求仍限制其在资源受限环境中的部署。知识蒸馏通过训练来自大型教师模型的小型学生模型来解决这一挑战。以往的研究为数据生成和学生模型训练引入了多种蒸馏方法。尽管这些方法相关性大,但对其对模型性能和可解释性影响的系统性考察尚不充分。本文通过对抗性-修正提示用于蒸馏数据生成,并综合现有方法用于训练,扩充了可用方法的集合。针对这些方法,我们提供基于广泛使用的常识问答(CQA)数据集的系统比较。虽然我们通过学生模型准确率衡量性能,但采用人类 grounding 研究来评估可解释性。我们贡献了新的蒸馏方法及其在性能和可解释性方面的比较。这应进一步推动小型语言模型的蒸馏,从而促进LLM技术更广泛的实用性和更快的传播。

关键词

引用

@article{arxiv.2504.16056,
  title  = {Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability},
  author = {Daniel Hendriks and Philipp Spitzer and Niklas Kühl and Gerhard Satzger},
  journal= {arXiv preprint arXiv:2504.16056},
  year   = {2025}
}