中文

分析影响函数在神经机器翻译中用于实例特定数据过滤的应用

计算与语言 2022-10-25 v1

摘要

客户反馈可作为改进商用机器翻译系统的重要信号。修复特定翻译错误的一种方案是移除相关错误训练实例并重新训练机器翻译系统,我们称之为实例特定数据过滤。影响函数(IF)已被证明能有效地为图像分类、有毒言论检测和蕴含任务等分类任务找到此类相关训练样本。给定一个探测实例,IF 通过测量该探测实例与一组训练实例在梯度空间中的相似性来找出有影响的训练样本。本工作中,我们考察影响函数在神经机器翻译(NMT)中的使用。我们对最先进的影响函数提出两种有效扩展,并在复制训练样本的子类问题上证明 IF 可比手工正则表达式更普遍地应用。

关键词

引用

@article{arxiv.2210.13281,
  title  = {Analyzing the Use of Influence Functions for Instance-Specific Data Filtering in Neural Machine Translation},
  author = {Tsz Kin Lam and Eva Hasler and Felix Hieber},
  journal= {arXiv preprint arXiv:2210.13281},
  year   = {2022}
}

备注

Accepted at WMT 2022