“别当我的奶酪?”:评估多语言 LLM 翻译中的文化细微差别
计算与语言
2025-10-08 v1
摘要
本 pilot 研究探讨了最新多语言 AI 模型在翻译象征性语言(如习语和双关语)时的本土化能力。该研究扩展了现有的 LLM 翻译研究和行业基准,后者强调语法准确性和标记级正确性,通过关注文化恰当性和整体本土化质量——这些因素对于现实应用中的营销和电子商务至关重要。为调查这些挑战,本项目评估了 87 份由 LLM 生成的翻译,涵盖 24 个区域方言的 20 种语言的电子商务营销邮件。在每个目标语言中,都有母语人士提供定量评分和定性反馈,对翻译的忠实度、语气、意义以及目标受众的贴合程度进行评估。我们的发现表明,尽管领先模型通常会产生语法正确的翻译,但文化细微差别的语言仍是一个明显的改进领域,常需大量人工润色。值得注意的是,尽管高资源全局语言在行业基准中名列前茅,但它们经常误译象征性表达和文字游戏。本工作挑战了数据量是机器翻译质量最可靠预测器的假设,提出文化恰当性是多语言 LLM 性能的关键决定因素——这一领域在现有学术和行业基准中尚未得到充分探索。作为一个概念验证,本 pilot 研究凸显了当前多语言 AI 系统在现实本土化用例中的局限性。本研究的结果支持进一步规模化研究的机遇,以提供可通用的见解并为在文化多样化环境中部署可靠的机器翻译工作流程提供指导。
引用
@article{arxiv.2509.21577,
title = {"Be My Cheese?": Assessing Cultural Nuance in Multilingual LLM Translations},
author = {Madison Van Doren and Cory Holland},
journal= {arXiv preprint arXiv:2509.21577},
year = {2025}
}