生成难以翻译的文本
计算与语言
2025-10-03 v2
摘要
来自真实世界的机器翻译基准快速被淘汰,因为大多数例子对最先进的翻译模型都相对容易。这限制了基准能够区分哪个模型更好或揭示模型弱点的能力。当前创建困难测试案例的方法,如抽样或从头合成,要么未能识别困难案例,要么缺乏多样性和自然性。灵感来自人类专家反复探寻模型失效的迭代过程,我们提出了MT-breaker方法,即通过大语言模型迭代细化源文本以增加其翻译难度。大语言模型不断查询目标机器翻译模型以引导生成困难案例。我们的方法生成的案例对目标MT模型更具挑战性,同时保持自然文本的多样性。虽然这些案例在生成时针对特定的机器翻译模型定制,但其难度也会转移到其他模型和语言上。
关键词
引用
@article{arxiv.2509.26592,
title = {Generating Difficult-to-Translate Texts},
author = {Vilém Zouhar and Wenda Xu and Parker Riley and Juraj Juraska and Mara Finkelstein and Markus Freitag and Daniel Deutsch},
journal= {arXiv preprint arXiv:2509.26592},
year = {2025}
}