适配印度尼西亚当地语言:零样本情境下的语言迁移性实证研究
计算与语言
2025-07-03 v1
摘要
本文探讨了通过情感分析任务,将预训练语言模型传输到印度尼西亚低资源当地语言的可行性。我们评估了零样本性能和基于适配器的迁移,在十个当地语言上使用不同类型的模型:单语印度尼西亚 BERT、多语言模型如 mBERT 和 XLM-R,以及一种称为 MAD-X 的模块化适配器方法。为更好地理解模型行为,我们将目标语言分为三类:见过的语言(包含在预训练中)、部分见过的语言(不包含但与见过的语言在语言学上有关联)以及未见过的语言(在预训练数据中不存在且不相关)。我们的结果揭示了这些分组之间存在明显的性能差异:多语言模型在见过的语言上表现最佳,在部分见过的语言上表现中等,在未见过的语言上表现较差。我们发现,MAD-X 能显著提升性能,尤其是针对见过和部分见过的语言,无需目标语言中的标记数据。此外,我们进一步分析了分词技术,发现虽然子词碎片化和与印度尼西亚语言的词汇重叠与预测质量呈弱相关性,但它们并不能完全解释观察到的性能差异。相反,模型对语言的先前暴露——无论是直接暴露还是通过相关语言暴露——是迁移成功最一致的预测器。
引用
@article{arxiv.2507.01645,
title = {Adapting Language Models to Indonesian Local Languages: An Empirical Study of Language Transferability on Zero-Shot Settings},
author = {Rifki Afina Putri},
journal= {arXiv preprint arXiv:2507.01645},
year = {2025}
}
备注
AMLDS 2025