多语言大语言模型与多语言性诅咒
计算与语言
2025-04-28 v2 计算机与社会
摘要
多语言大语言模型(LLMs)在自然语言处理(NLP)研究人员和从业者中获得了广泛欢迎。这些模型在大型数据集上训练,在各种语言中表现出熟练度,并在众多下游任务中展示了有效性。本文导航了多语言LLMs的领域,提供了其技术方面的入门概述。它解释了底层架构、目标函数、预训练数据源和分词方法。这项工作探讨了不同模型类型的独特特征:仅编码器模型(mBERT, XLM-R)、仅解码器模型(XGLM, PALM, BLOOM, GPT-3)和编码器-解码器模型(mT5, mBART)。此外,它解决了多语言LLMs的一个主要局限性——多语言性诅咒——并讨论了当前克服它的尝试。
引用
@article{arxiv.2406.10602,
title = {Multilingual Large Language Models and Curse of Multilinguality},
author = {Daniil Gurgurov and Tanja Bäumel and Tatiana Anikina},
journal= {arXiv preprint arXiv:2406.10602},
year = {2025}
}