面向语码转换输入数据的多语言语言模型增强
计算与语言
2025-03-12 v1
摘要
语码转换,或在单次对话中交替使用不同语言,给多语言语言模型在 NLP 任务上带来了挑战。本研究调查了在语码转换数据集上预训练多语言 BERT(mBERT)是否能提高模型在词性标注、情感分析、命名实体识别和语言识别等关键 NLP 任务上的性能。我们使用西班牙英语混用推文数据集进行预训练,并将预训练模型与基线模型进行评估对比。我们的研究结果表明,我们预训练的 mBERT 模型在给定任务中优于或匹配基线模型,其中在词性标注上取得了最显著的改进。此外,我们的潜在分析揭示了用于语言识别任务的英语和西班牙语嵌入更加同质,为未来的建模工作提供了见解。本研究突出了调整多语言语言模型以适应语码转换输入数据的潜力,以便在全球化与多语言语境中获得高级效用。未来的工作包括将实验扩展到其他语言对、纳入多形态数据,以及探索更好地理解上下文依赖语码转换的方法。
引用
@article{arxiv.2503.07990,
title = {Enhancing Multilingual Language Models for Code-Switched Input Data},
author = {Katherine Xie and Nitya Babbar and Vicky Chen and Yoanna Turura},
journal= {arXiv preprint arXiv:2503.07990},
year = {2025}
}