MEXA: 通过跨语言对齐对以英语为中心的大语言模型进行多语言评估
计算与语言
2025-06-03 v2 人工智能
摘要
以英语为中心的大语言模型通常表现出强大的多语言能力。然而,对于许多其他语言,它们的多语言性能仍不明确且评估不足。大多数多语言基准测试侧重于经典NLP任务或覆盖极少数语言。我们引入了MEXA,一种使用平行句评估预训练以英语为中心的LLM多语言能力的方法,平行句可用于比现有下游任务更多的语言。MEXA利用了以英语为中心的LLM在其中间层使用英语作为枢轴语言的特点。MEXA使用平行句计算英语和非英语语言之间的对齐,以评估语言理解从英语到其他语言的迁移。这种对齐可用于估计模型在不同语言中的性能。我们使用各种平行数据集(FLORES-200和Bible)、模型(Llama系列、Gemma系列、Mistral和OLMo)以及已建立的下游任务(Belebele、m-MMLU和m-ARC)进行了控制实验。我们探索了在仅解码器模型中计算嵌入的不同方法。我们的结果表明,MEXA在其默认设置下,其预测分数与跨语言的实际任务性能之间的平均皮尔逊相关系数达到0.90。这表明MEXA是评估以英语为中心的LLM多语言能力的可靠方法,为理解它们的多语言潜力和LLM的内部工作机制提供了更清晰的认识。排行榜:https://cis-lmu-mexa.hf.space,代码:https://github.com/cisnlp/MEXA。
引用
@article{arxiv.2410.05873,
title = {MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment},
author = {Amir Hossein Kargaran and Ali Modarressi and Nafiseh Nikeghbal and Jana Diesner and François Yvon and Hinrich Schütze},
journal= {arXiv preprint arXiv:2410.05873},
year = {2025}
}
备注
ACL Findings 2025