中文

让语言模型清理你的含噪翻译数据

计算与语言 2023-10-25 v3 人工智能

摘要

Transformer 模型在神经机器翻译(NMT)中展现出了卓越的性能。然而,它们对噪声输入的脆弱性在实际部署中构成了重大挑战,因为从噪声输入生成干净输出至关重要。MTNT 数据集被广泛用作评估 NMT 模型对噪声输入鲁棒性的基准。尽管如此,由于源句和目标句中均存在噪声,其效用受到限制。为克服这一局限,我们致力于清理 MTNT 中目标句的噪声,使其更适于作为噪声评估基准。借助大语言模型(LLMs)的能力,我们观察到它们在去噪方面令人印象深刻的实力。例如,它们能在考虑语义的前提下移除表情符号。此外,我们展示了 LLM 能有效改写俚语、行话与脏话。所得数据集称为 C-MTNT,其目标句噪声显著减少,同时保留了原句的语义完整性。我们的人工与 GPT-4 评估也得出了完全一致的结论:LLM 在该任务上表现良好。最后,在 C-MTNT 上的实验展示了其在评估 NMT 模型鲁棒性方面的有效性,凸显了先进语言模型用于数据清理的潜力,并强调 C-MTNT 是一项宝贵资源。

关键词

引用

@article{arxiv.2310.13469,
  title  = {Ask Language Model to Clean Your Noisy Translation Data},
  author = {Quinten Bolding and Baohao Liao and Brandon James Denis and Jun Luo and Christof Monz},
  journal= {arXiv preprint arXiv:2310.13469},
  year   = {2023}
}

备注

EMNLP 2023, Findings