中文

探索多语言 LLM 在真实世界噪声数据上的鲁棒性

计算与语言 2025-01-15 v1

摘要

大型语言模型( LLM)是在可能包含人类拼写错误的 Web 数据上训练的,但它们是否对类似的真实世界噪声具有鲁棒性?本文研究了9种参数范围从0.2B到13B的语言模型在3种不同 NLP 任务中的性能,这些任务包括自然语言推理(NLI)、命名实体识别(NER)和意图分类(IC)。我们在6种不同语言上进行实验,并使用维基百科编辑历史构建了真实世界噪声的词典。我们显示,所研究模型在干净和噪声测试数据之间的性能差距在所有数据集和语言的平均值范围为2.3至4.3个绝对百分点。此外,mT5 模型总体上比 BLOOM、Falcon 和 BERT 类模型更具鲁棒性。特别是,mT5(13B)在所有3种任务中以及4种6种语言中表现最为鲁棒。

关键词

引用

@article{arxiv.2501.08322,
  title  = {Exploring Robustness of Multilingual LLMs on Real-World Noisy Data},
  author = {Amirhossein Aliakbarzadeh and Lucie Flek and Akbar Karimi},
  journal= {arXiv preprint arXiv:2501.08322},
  year   = {2025}
}