中文

大型语言模型中的文化感知机器翻译:基准测试与调查

计算与语言 2026-04-28 v1

摘要

大型语言模型(LLMs)在通用机器翻译方面取得了强大的性能,但其在文化感知场景中的能力仍不被充分理解。为填补这一差距,我们引入CanMT——一个面向机器翻译的文化感知新颖并行数据集,以及一个建立在理论基础之上的多维评估框架,用于评估文化翻译质量。利用CanMT,我们系统评估了广泛的LLMs和翻译系统在不同的翻译策略约束下。我们的发现显示,模型之间存在显著的性能差异,并表明翻译策略对模型行为有系统性影响。进一步的分析表明,翻译难度在不同类型的文化专项条目之间存在差异,且模型对文化专项知识的识别与其在翻译输出中正确操作之间的仍存鸿沟。此外, incorporating reference翻译被证明在LLM-as-a-judge中显著提升评估可靠性,凸显了其在评估文化感知翻译质量中的essential作用。该语料库和代码均可在CanMT处获取。

关键词

引用

@article{arxiv.2604.24361,
  title  = {Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation},
  author = {Zekun Yuan and Yangfan Ye and Xiaocheng Feng and Baohang Li and Qichen Hong and Yunfei Lu and Dandan Tu and Bing Qin},
  journal= {arXiv preprint arXiv:2604.24361},
  year   = {2026}
}

备注

26pages,25 figures ACL2026 main conference, long paper