探索大语言模型压缩极限:基于问答任务的知识蒸馏研究
计算与语言
2025-07-11 v1 机器学习
摘要
大型语言模型 (LLMs) 在多种自然语言处理任务中展现出卓越的性能,但其计算需求阻碍了在资源受限环境中的部署。本文研究在保持对问答 (QA) 任务性能的前提下,对大语言模型进行知识蒸馏 (KD) 压缩的可能范围。我们评估了从 Pythia 和 Qwen2.5 系列模型蒸馏得到的学生模型,在零-shot 和 one-shot 提示条件下,对两个问答基准数据集 SQuAD 和 MLQA 进行测试。结果表明,学生模型在保持超过 90% 教师模型性能的同时,将参数数量降低最高可达 57.1%。此外,one-shot 提示相较于 zero-shot 设置为两者模型族都带来了额外的性能提升。这些发现凸显了模型效率与任务性能之间的权衡,表明结合最小化提示,知识蒸馏可产生适用于资源受限应用的紧凑且高效的问答系统。
引用
@article{arxiv.2507.07630,
title = {Exploring the Limits of Model Compression in LLMs: A Knowledge Distillation Study on QA Tasks},
author = {Joyeeta Datta and Niclas Doll and Qusai Ramadan and Zeyd Boukhers},
journal= {arXiv preprint arXiv:2507.07630},
year = {2025}
}
备注
Accepted four publication at the 26th Meeting of the Special Interest on Discourse and Dialogue