中文

字节即所需:基于字节的端到端多语言语音识别与合成

音频与语音处理 2018-11-27 v1 计算与语言 机器学习 声音

摘要

我们提出两个端到端模型:Audio-to-Byte(A2B)和Byte-to-Audio(B2A),用于多语言语音识别与合成。先前工作主要使用字符、子词或词作为建模文本的单位。这些单位难以扩展到具有大词汇量的语言,尤其在多语言处理中。本工作中,我们通过Unicode字节序列,具体而言每个字符的UTF-8变长字节序列来建模文本。字节使我们能够避免大词汇量语言中的大型softmax,并在多语言模型中共享表示。我们表明,在单语言端到端语音识别中,字节在多种语言上优于字形字符。此外,我们的多语言字节模型相对各自单语言基线平均相对提升4.4%。在日英码切换语音中,我们的多语言字节模型相对单语言基线相对提升38.6%。最后,我们提出一个使用字节表示的端到端多语言语音合成模型,其匹配我们单语言基线的性能。

关键词

引用

@article{arxiv.1811.09021,
  title  = {Bytes are All You Need: End-to-End Multilingual Speech Recognition and Synthesis with Bytes},
  author = {Bo Li and Yu Zhang and Tara Sainath and Yonghui Wu and William Chan},
  journal= {arXiv preprint arXiv:1811.09021},
  year   = {2018}
}

备注

submitted to ICASSP 2019