中文

用于非规范罗马化转写的语音与视觉先验解密方法

计算与语言 2020-05-07 v1

摘要

非规范罗马化是一种人类在非正式数字通信中用于将非拉丁文字语言编码到常见键盘上拉丁字符集中的特殊过程。字符替换选择因用户而异,但已被证明受跨多种语言观察到的相同主要原则支配——即字符对常通过语音或视觉相似性相关联。我们提出了一种噪声信道 WFST 级联模型,以无监督方式从观测到的罗马化文本中解密原始非拉丁文字。我们直接在来自两种语言的罗马化数据上训练模型:埃及阿拉伯语和俄语。我们证明,通过字符映射上的语音和视觉先验加入归纳偏置,可大幅改善模型在两种语言上的性能,使结果更接近有监督上限。最后,我们引入了一个从俄罗斯社交网站收集并部分标注用于实验的罗马化俄语新数据集。

关键词

引用

@article{arxiv.2005.02517,
  title  = {Phonetic and Visual Priors for Decipherment of Informal Romanization},
  author = {Maria Ryskina and Matthew R. Gormley and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2005.02517},
  year   = {2020}
}

备注

To appear at ACL 2020