中文

MultiNRC:面向大语言模型的具挑战性且本土化多语言推理评估基准

计算与语言 2025-07-24 v1 人工智能

摘要

尽管近期的大型语言模型(LLMs)在英语推理基准上取得快速进展,但评估此类 LLMs 在多语言推理能力方面,尤其是在多样化语言和文化语境下,仍显不足。现有的多语言推理基准通常通过翻译现有英语推理基准而构建,倾向于推理问题的背景局限于英语语言和文化。本文引入 Multilingual Native Reasoning Challenge(MultiNRC),一个旨在评估 LLMs 在由母语者以法语、西班牙语和中文撰写的1000多道本土化、语言学及文化相关推理问题上的能力的基准。MultiNRC 涵盖四类核心推理类别:语言特定语言推理、文字游戏与谜语、文化/传统推理以及具文化相关性的数学推理。针对文化/传统推理和具文化相关性的数学推理,我们还提供由母语者熟悉英语的译者手动翻译的英文等价版本。这一套英文等价版本可直接比较 LLMs 在其他语言与英语中的推理能力。我们系统评估了覆盖主流 LLM 家族的14个领先 LLMs 在 MultiNRC 及其英文等价集合上的表现。结果显示:(1) 当前 LLMs 在本土化多语言推理方面仍欠佳,无一模型在 MultiNRC 上得分超过50%;(2) LLMs 在处理语言、文化和逻辑推理任务时表现出显著的优势与弱点;(3) 大多数模型在英语数学推理中显著优于原语言 (+10%),表明在文化嵌入知识方面仍面临挑战。

关键词

引用

@article{arxiv.2507.17476,
  title  = {MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs},
  author = {Alexander R. Fabbri and Diego Mares and Jorge Flores and Meher Mankikar and Ernesto Hernandez and Dean Lee and Bing Liu and Chen Xing},
  journal= {arXiv preprint arXiv:2507.17476},
  year   = {2025}
}