如何在噪声环境中学习?自校正机器翻译中的真实数据噪声
计算与语言
2025-02-10 v2 人工智能
摘要
大规模网络抓取的平行数据中包含大量噪声。语义错位是噪声的主要来源,给机器翻译系统的训练带来挑战。本文首先引入一种受语义相似度控制的错位模拟过程,旨在贴近真实网络爬取语料库中出现的错位句子。在我们的模拟错位噪声设置下,我们定量分析了其对机器翻译的影响,并表明广泛使用的预过滤器对噪声检测的有效性有限。这凸显了更细粒度处理难以检测错位噪声的必要性。基于观察到模型自身知识在标记层面区分错位数据和干净数据可靠性日益增加的现象,我们提出了自校正方法,即逐步增加对模型自身知识的信任,以纠正训练监督。全面实验表明,我们的方法在既有模拟错位噪声,也应用于真实世界、嘈杂的网络抓取数据集时,能显著提升翻译性能,跨越多种翻译任务。
引用
@article{arxiv.2407.02208,
title = {How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine Translation},
author = {Yan Meng and Di Wu and Christof Monz},
journal= {arXiv preprint arXiv:2407.02208},
year = {2025}
}