AfroXLMR-Comet:面向低资源语言的注意力匹配多语言知识蒸馏
计算与语言
2025-02-26 v1 人工智能
信息检索
机器学习
摘要
通过知识蒸馏实现语言模型压缩已成为在资源受限环境中部署大型语言模型的热门方法。然而,现有方法在蒸馏多语言模型时往往难以保持性能,尤其是针对低资源语言。本文提出一种新颖的混合蒸馏方法,结合传统知识蒸馏与简化注意力匹配机制,专为多语言情境设计。我们引入一种极度紧凑的学生模型架构,显著小于传统多语言模型。我们在五个非洲语言上进行评估:Kinyarwanda、Swahili、Hausa、Igbo 和 Yoruba。蒸馏后的学生模型AfroXLMR-Comet成功捕获了更大教师模型(AfroXLMR-Large)的输出分布和内部注意力模式,同时将模型规模缩小超过85%。实验结果表明,我们的混合方法在性能上与教师模型相当,保持准确率在原模型性能的85%以内,同时所需计算资源大幅减少。我们的工作为在资源受限环境中部署高效多语言模型提供了实用框架,尤其有利于涉及非洲语言的应用。
引用
@article{arxiv.2502.18020,
title = {AfroXLMR-Comet: Multilingual Knowledge Distillation with Attention Matching for Low-Resource languages},
author = {Joshua Sakthivel Raju and Sanjay S and Jaskaran Singh Walia and Srinivas Raghav and Vukosi Marivate},
journal= {arXiv preprint arXiv:2502.18020},
year = {2025}
}