通过教师语言选择与跨语言自蒸馏缓解多语言预训练语言模型中的语言级性能差异
计算与语言
2024-04-15 v1 人工智能
摘要
大规模多语言预训练语言模型在跨语言任务中表现出色,但在同一 mPLM 内部,不同语言之间存在显著的性能差异。以往的研究试图通过使用多语言数据对 mPLM 进行有监督微调来缩小这些差异。然而,获取带标签的多语言数据非常耗时,并且使用有限的带标签多语言数据微调 mPLM 仅能封装特定于该带标签数据的知识。因此,我们引入 ALSACE,利用从表现良好语言中学到的知识来指导同一 mPLM 中表现不佳的语言,从而消除对额外带标签多语言数据的需求。实验表明,ALSACE 有效缓解了各种 mPLM 中的语言级性能差异,同时在从全资源到有限资源的不同多语言自然语言理解(NLU)任务上表现出具有竞争力的性能。我们方法的代码可在 https://github.com/pkunlp-icler/ALSACE 获取。
关键词
引用
@article{arxiv.2404.08491,
title = {Mitigating Language-Level Performance Disparity in mPLMs via Teacher Language Selection and Cross-lingual Self-Distillation},
author = {Haozhe Zhao and Zefan Cai and Shuzheng Si and Liang Chen and Yufeng He and Kaikai An and Baobao Chang},
journal= {arXiv preprint arXiv:2404.08491},
year = {2024}
}
备注
NAACL 2024