中文

对负样本进行非似然微调显著改善零样本翻译

计算与语言 2023-09-29 v1

摘要

零样本翻译(ZST)通常基于多语言神经机器翻译模型,旨在翻译训练数据中未见过的语言对。在推理过程中引导零样本语言映射的常规做法是刻意插入源语言与目标语言 ID,例如英语用 <EN>、德语用 <DE>。近期研究表明,语言 ID 有时会失效于引导 ZST 任务,使其遭受离目标问题(生成译文中存在非目标语言词),因而难以将当前多语言翻译模型应用于广泛的零样本语言场景。为理解语言 ID 的导航能力何时及为何被削弱,我们比较了 ZST 方向上的两种极端解码器输入情形:离目标(OFF)与在目标(ON)情形。通过对这些情形在教师强制下的上下文词表示(CWRs)进行对比可视化,我们表明:1)当句子与 ID 匹配时(ON 设定),不同语言的 CWRs 被有效分布于独立区域;2)若句子与 ID 不匹配(OFF 设定),不同语言的 CWRs 呈混沌分布。我们的分析表明,尽管在理想 ON 设定下表现良好,语言 ID 在面对离目标词元时变得脆弱并丧失导航能力,而离目标词元在推理中常见但在训练场景中稀少。对此,我们对负(OFF)样本采用非似然微调以最小化其概率,使语言 ID 能在训练时区分在目标与离目标词元。跨越 40 个 ZST 方向的实验表明,我们的方法将离目标比率平均降低 -48.0%,带来 +9.1 BLEU 提升,且仅额外产生 +0.3% 的微调开销。

关键词

引用

@article{arxiv.2309.16599,
  title  = {Unlikelihood Tuning on Negative Samples Amazingly Improves Zero-Shot Translation},
  author = {Changtong Zan and Liang Ding and Li Shen and Yibin Lei and Yibing Zhan and Weifeng Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2309.16599},
  year   = {2023}
}