自动生成中文同音词以探测机器翻译质量估计系统
计算与语言
2025-03-21 v1
摘要
评估用户生成内容(UGC)的机器翻译(MT)涉及独特的挑战,例如检查源文本中的情感细微差别是否在目标文本中得到保留。最近的研究提出了与情感相关的数据集、框架和模型,以在不依赖参考翻译的情况下自动评估中文 UGC 的 MT 质量。然而,这些模型对于保留情感细微差别这一挑战的鲁棒性在很大程度上尚未被探索。为了填补这一空白,我们引入了一种受信息论启发的新方法,该方法利用自信息概念生成与情感相关的、具有挑战性的中文同音词。我们的方法生成的同音词在情感保留方面被观察到会导致翻译错误,并暴露了 MT 系统及其评估方法在处理情感 UGC 时的脆弱性。我们使用人工评估来评估我们方法生成的同音词的质量,并将其与现有方法进行比较,结果表明我们的方法与人类判断的相关性更高。生成的中文同音词及其人工翻译被用于生成扰动,并探测现有质量评估模型的鲁棒性,包括使用多任务学习训练的模型、多语言语言模型的微调变体,以及大型语言模型。我们的结果表明,规模更大的 LLM 对此类扰动表现出更高的稳定性和鲁棒性。我们发布数据和代码以供可复现性和进一步研究。
引用
@article{arxiv.2503.16158,
title = {Automatically Generating Chinese Homophone Words to Probe Machine Translation Estimation Systems},
author = {Shenbin Qian and Constantin Orăsan and Diptesh Kanojia and Félix do Carmo},
journal= {arXiv preprint arXiv:2503.16158},
year = {2025}
}
备注
Accepted to the 10th Workshop on Noisy and User-generated Text at NAACL 2025