自分段神经网:音段与声调应同步还是异步?
音频与语音处理
2022-03-29 v1 声音
摘要
音段(国际音标 IPA 的 segmental 单位)被用于大多数人类语言的词汇区分;声调(IPA 的 suprasegmental 单位)约用于 70% 的语言。以往许多研究探索了自动语音识别(ASR)音段模型的跨语言适配,但极少探索音段与声调之间同步性的多语言与跨语言迁移。本文测试了四种基于连接主义时序分类(CTC)的声学模型,它们在音段与声调间所施加的同步程度各不相同。模型在三种语言上进行多语言训练与测试,随后在第四种语言上适配并跨语言测试。同步与异步模型在多语言与跨语言设定下均有效。同步模型在音段+声调联合层上取得更低错误率,但异步训练带来更低的声调错误率。
引用
@article{arxiv.2007.14351,
title = {Autosegmental Neural Nets: Should Phones and Tones be Synchronous or Asynchronous?},
author = {Jialu Li and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:2007.14351},
year = {2022}
}
备注
Accepted to Interspeech 2020