中文

“要我的奶酪吗?”:面向多语言大语言模型的文化细微差异基准测试

计算与语言 2026-05-29 v2

摘要

我们提出了一个大规模人类评估基准,用于评估由主流多语言大语言模型 (LLM) 生成的机器翻译在文化本地化方面的表现。现有 MT 基准侧重于词汇水平和语法准确性,常常忽视面向实际本地化所需的语用和文化嵌入能力。基于 87 组翻译(覆盖 20 种语言)的初步研究,我们在 15 种目标语言上评估了 7 个多语言 LLM,每个语言都有 5 位母语者进行评分。每个评分者对完整文本翻译以及文化细微差异语言片段(包括习语、双关语、节日及文化嵌入概念)进行评分,采用的有序 0-3 比例评分标准;片段评分还包含一个 NA 选项,用于标记未翻译的片段。在完整文本评估中,平均整体质量不错(1.68/3):GPT-5(2.10/3)、Claude Sonnet 4(1.97/3)和 Mistral Medium 3.1(1.84/3)位居最强阵容,错误较少。片段级结果显示出明显的类别差异:节日(2.20/3)和文化概念(2.19/3)的翻译质量显著高于习语(1.65/3)和双关语(1.45/3),而习语最容易被标记为未翻译。我们使用 Krippendorff 相关系数和 Gwet AC2 进行评价者间一致性评估,整体中等(Krippendorff 相关系数 = 0.45),双关语的一致性最低。这些发现表明,语法正确性与文化共鸣之间仍存显著差距。据我们所知,这是首个聚焦文化细微差异的多语言、人工标注基准。结果凸显了需要文化信息训练数据的需求,以及支持系统化基准测试的跨语言语用改进和评估框架。

关键词

引用

@article{arxiv.2602.04729,
  title  = {"Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs},
  author = {Madison Van Doren and Casey Ford and Jennifer Barajas and Riley VanMeter and Cory Holland},
  journal= {arXiv preprint arXiv:2602.04729},
  year   = {2026}
}

备注

ACL 2026: Natural Language Generation, Evaluation, and Metrics (GEM) Workshop