中文

修补 Charformer 中的信息泄漏以实现高效的字符级生成

计算与语言 2022-05-30 v1

摘要

基于字符的表示相比基于子词的表示,对于形态丰富的语言具有重要优势。它们对噪声输入具有更强的鲁棒性,且不需要单独的分词步骤。然而,它们也有一个关键缺点:显著增加了文本序列的长度。Charformer 中的 GBST 方法对字符进行分组(即下采样)以解决此问题,但在应用于 Transformer 解码器时会造成信息泄漏。我们解决了这一信息泄漏问题,从而在解码器中实现字符分组。我们表明,在机器翻译(NMT)中,Charformer 下采样相较于先前的下采样方法在翻译质量上无明显优势,但其训练速度可快约 30%。在英语—土耳其语翻译上表现出的良好性能,表明了字符级模型在形态丰富语言上的潜力。

关键词

引用

@article{arxiv.2205.14086,
  title  = {Patching Leaks in the Charformer for Efficient Character-Level Generation},
  author = {Lukas Edman and Antonio Toral and Gertjan van Noord},
  journal= {arXiv preprint arXiv:2205.14086},
  year   = {2022}
}