自适应权重的知识蒸馏
机器学习
2025-01-07 v1 应用统计
摘要
尽管大模型在包括自然语言和计算机视觉在内的许多领域展现出解决大规模问题的强大能力,但由于计算和能源限制,其庞大的参数难以部署在实时系统中。针对这一点,通过教师-学生架构的知识蒸馏提供了一条可持续的途径,将大模型的知识压缩到更易于管理的规模,而不会显著影响性能。为了增强该框架的鲁棒性和可解释性,理解单个训练数据如何影响模型性能至关重要,这是一个尚未充分探索的领域。我们提出了**自适应影响权重的知识蒸馏(KD-AIF)**框架,该框架利用鲁棒统计学中的影响函数为训练数据分配权重,基于四个关键的SAFE原则:可持续性、准确性、公平性和可解释性。这种新颖的方法不仅优化了蒸馏过程,还通过揭示不同数据的重要性增加了透明度。对KD-AIF框架内各种更新机制的探索进一步阐明了其显著提高学生模型学习效率和泛化能力的潜力,标志着向更可解释和可部署的大模型迈出了一步。KD-AIF在知识蒸馏中有效,同时在半监督学习中表现出色,在多个基准测试(CIFAR-100、CIFAR-10-4k、SVHN-1k和GLUE)上优于现有的基线和方法。
引用
@article{arxiv.2501.02705,
title = {Knowledge Distillation with Adapted Weight},
author = {Sirong Wu and Xi Luo and Junjie Liu and Yuhui Deng},
journal= {arXiv preprint arXiv:2501.02705},
year = {2025}
}