中文

面向语素文字起源口语的多模态神经发音建模

计算与语言 2018-09-13 v1

摘要

大多数语言的字素编码发音,尽管有些比其他的更显式。像西班牙语这样的语言在其字素与音素之间有直接的映射,而像英语这样的语言该映射更为复杂。诸如粤语之类的口语在发音建模上呈现更多挑战:(1)它们没有标准的书写形式,(2)最接近的字素起源是语素文字汉字,其中仅有这些语素文字字符的子集隐式编码发音。在这项工作中,我们提出一种多模态方法来预测粤语语素文字字符的发音,使用具有语素文字几何表示和历史相关语言中同源词发音的神经网络。所提出的框架相对于单模态和多模态基线分别提升了 18.1% 和 25.0% 的性能。

关键词

引用

@article{arxiv.1809.04203,
  title  = {Multimodal neural pronunciation modeling for spoken languages with logographic origin},
  author = {Minh Nguyen and Gia H. Ngo and Nancy F. Chen},
  journal= {arXiv preprint arXiv:1809.04203},
  year   = {2018}
}

备注

Accepted to EMNLP 2018