多语言模型在方言NLP任务中的分词与表示偏差
计算与语言
2025-09-25 v1 人工智能
摘要
方言数据具有对人类而言微小但对模型性能有显著影响的语言变异。这种方言差距与多种因素(如数据量、经济和社会因素)相关,但其影响被证明是不一致的。在本工作中,我们更直接地研究了影响模型性能的因素:将分词均衡性(TP)和信息均衡性(IP)——作为预训练多语言模型中表示偏差的度量——与下游性能相关联。我们在三个任务上对比了最先进的仅解码器大语言模型与基于编码器的模型:方言分类、主题分类和抽取式问答,并控制了不同的书写系统(拉丁字母 vs. 非拉丁字母)和资源可用性(高 vs. 低)。我们的分析表明,TP更能预测依赖句法和形态学线索的任务(如抽取式问答)的性能,而IP更能预测语义任务(如主题分类)的性能。补充分析,包括分词器行为、词汇覆盖率和定性洞察,揭示了大语言模型的语言支持声明往往可能掩盖在书写系统或词元层面更深层次的不匹配。
引用
@article{arxiv.2509.20045,
title = {Tokenization and Representation Biases in Multilingual Models on Dialectal NLP Tasks},
author = {Vani Kanjirangat and Tanja Samardžić and Ljiljana Dolamic and Fabio Rinaldi},
journal= {arXiv preprint arXiv:2509.20045},
year = {2025}
}
备注
Accepted in EMNLP-2025 Main conference