重新审视语言建模中的音节及其在低资源机器翻译中的应用
计算与语言
2022-10-07 v1
摘要
语言建模与机器翻译任务大多使用子词或字符输入,但音节很少被使用。音节相较字符提供更短的序列,比词素所需的分词规则更不专门化,且其切分不受语料库规模影响。在本研究中,我们首先探索音节在21种语言开放词表语言建模中的潜力。我们对六种语言使用基于规则的音节划分方法,并对其余语言采用连字符化作为音节划分的替代方案。在困惑度相当的情况下,我们表明音节优于字符及其他子词。此外,我们研究了音节在非亲属且低资源的语言对(西班牙语——希皮博-科尼博语)神经机器翻译中的重要性。在成对与多语言系统中,当翻译为具有透明正字法的高合成性语言(希皮博-科尼博语)时,音节优于无监督子词及进一步的形态分割方法。最后,我们进行了一些人评评估,并讨论了局限与机遇。
引用
@article{arxiv.2210.02509,
title = {Revisiting Syllables in Language Modelling and their Application on Low-Resource Machine Translation},
author = {Arturo Oncevay and Kervy Dante Rivas Rojas and Liz Karen Chavez Sanchez and Roberto Zariquiey},
journal= {arXiv preprint arXiv:2210.02509},
year = {2022}
}
备注
COLING 2022, short-paper