基于模型的零样态跨语言迁移源语言排序
计算与语言
2025-10-15 v2
摘要
我们提出了 NN-Rank,一种用于跨语言迁移中对源语言进行排序的算法,利用多语言模型中的隐藏表示以及无标签目标语言数据。我们实验使用两种预训练的多语言模型和两种任务:词性标注(POS)和命名实体识别(NER)。我们考虑 51 种源语言,并在 POS 和 NER 上分别评估 56 种和 72 种目标语言。使用域内数据时,NN-Rank 对于 POS 和 NER 的 NDCG 提升最高可达 35.56 和 18.14。由于先前方法可在目标语言数据不可用时回退到语言级别特征,我们展示了 NN-Rank 仅使用《圣经》这一大量语言可用且域外的语料时仍能保持竞争力。对无标签目标数据量的消融实验表明,即使数据量仅为 25 条,NN-Rank 也能产生高质量的排序,达到使用全部目标数据的 92.8% 的 NDCG。
引用
@article{arxiv.2510.03202,
title = {Model-Based Ranking of Source Languages for Zero-Shot Cross-Lingual Transfer},
author = {Abteen Ebrahimi and Adam Wiemerslage and Katharina von der Wense},
journal= {arXiv preprint arXiv:2510.03202},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Main)