多语言场景下人与神经机器翻译的自动判别
计算与语言
2023-06-01 v1
摘要
我们处理自动判别人类翻译与机器翻译的任务。与大多数先前工作不同,我们在多语言设定下进行实验,考虑多种语言和多语言预训练语言模型。我们表明,在单一源语言(本例中为德英)平行数据上训练的分类器,仍能在来自不同源语言的英文翻译上表现良好,即便这些机器翻译由不同于训练所用系统产生。此外,我们证明在多语言分类器输入中纳入源文本,相较于单语分类器,可提升(i)其准确率和(ii)其在跨系统评估上的鲁棒性。进而,我们发现使用多源语言(德语、俄语和汉语)的训练数据往往能提升单语与多语分类器的准确率。最后,我们展示双语分类器及多源语言训练的分类器受益于在更长文本序列而非句子上训练。
引用
@article{arxiv.2305.19757,
title = {Automatic Discrimination of Human and Neural Machine Translation in Multilingual Scenarios},
author = {Malina Chichirau and Rik van Noord and Antonio Toral},
journal= {arXiv preprint arXiv:2305.19757},
year = {2023}
}
备注
Accepted at EAMT2023