神经机器翻译中字节对编码对集外词的有效性研究
软件工程
2022-08-11 v1 人工智能
摘要
神经机器翻译(NMT)是一个开放词表问题。因此,处理训练期间未出现的词(即集外词(OOV))长期以来是NMT系统的一项基本挑战。解决该问题的主要方法是字节对编码(BPE),它将词(包括OOV词)切分为子词片段。BPE在广泛的翻译任务上依据自动评价指标取得了令人印象深刻的成果。尽管常假定通过使用BPE,NMT系统能够处理OOV词,但BPE在翻译OOV词上的有效性尚未被显式度量。本文中,我们研究BPE在词级别上成功翻译OOV词的程度。我们基于词类型、片段数量、交叉注意力权重以及片段n-gram在训练数据中的频率来分析OOV词的翻译质量。实验表明,尽管谨慎的BPE设置在不同数据集上翻译OOV词似乎相当有用,仍有相当比例的OOV词被错误翻译。此外,我们强调了BPE在翻译OOV词时针对特殊情况(如命名实体以及所涉语言彼此语言上相近时)的略高有效性。
引用
@article{arxiv.2208.05227,
title = {Multi-View Pre-Trained Model for Code Vulnerability Identification},
author = {Xuxiang Jiang and Yinhao Xiao and Jun Wang and Wei Zhang},
journal= {arXiv preprint arXiv:2208.05227},
year = {2022}
}
备注
Accepted By WASA'2022