理解多语言微调中语言特定类别不平衡的影响
计算与语言
2024-02-21 v1
摘要
我们研究了一类在现实多语言分类数据集中经常存在的不平衡效应:标签在不同语言间分布不均。我们提供的证据表明,在此类不平衡数据集上微调基于 Transformer 的大语言模型(LLM)会导致性能下降、潜在空间中语言分离更加明显,以及促进无信息特征的使用。我们修改了传统的类别加权方法以应对不平衡,即为每种语言单独计算类别权重,并表明这有助于减轻这些不利影响。这些结果提高了人们对多语言微调中语言特定类别不平衡负面效应的认识,以及模型如何学会依赖语言分离来执行任务。
引用
@article{arxiv.2402.13016,
title = {Understanding the effects of language-specific class imbalance in multilingual fine-tuning},
author = {Vincent Jung and Lonneke van der Plas},
journal= {arXiv preprint arXiv:2402.13016},
year = {2024}
}
备注
To be published in: Findings of the Association for Computational Linguistics: EACL 2024