基于音译法的跨语言知识迁移:面向极低资源查克马语言的遮盖语言模型微调
计算与语言
2025-11-27 v2
摘要
作为一种印度-阿拉伯语,查克马语言因数据稀缺而在语言模型中几乎未被代表。本文引入了一个来自查克马文学作品、经本土语使用者验证的情境连贯巴ngla-音译查克马语料库。我们使用该数据集对六个编码型转换器模型进行微调,包括多语言模型(mBERT、XLM-RoBERTa、DistilBERT)、区域模型(BanglaBERT、IndicBERT)以及单语英语模型(DeBERTaV3),在遮盖语言模型(MLM)任务上进行训练。我们的实验显示,针对巴ngla-音译查克马语进行微调后的多语言模型在性能上优于预训练模型,实现最高达73.54%的词元准确率,困惑度可低至2.90。我们的分析进一步突显了数据质量对模型性能的影响,指出 OCR 流程在处理形态丰富的印度脚本方面的局限性。我们的研究表明,巴ngla-音译查克马语言对查克马语言的迁移学习非常有效,我们发布了该数据集以鼓励进一步研究多语言低资源语言建模。
引用
@article{arxiv.2510.09032,
title = {Exploring Cross-Lingual Knowledge Transfer via Transliteration-Based MLM Fine-Tuning for Critically Low-resource Chakma Language},
author = {Adity Khisa and Nusrat Jahan Lia and Tasnim Mahfuz Nafis and Zarif Masud and Tanzir Pial and Shebuti Rayana and Ahmedul Kabir},
journal= {arXiv preprint arXiv:2510.09032},
year = {2025}
}