中文

SoundChoice:具有语义消歧的字素到音素模型

声音 2022-07-29 v1 机器学习 音频与语音处理

摘要

端到端语音合成模型直接将输入字符转换为音频表示(如频谱图)。尽管性能令人印象深刻,此类模型难以对拼写相同词的发音进行消歧。为缓解该问题,可采用独立的字素到音素(G2P)模型,在合成音频前将字符转换为音素。本文提出 SoundChoice,一种处理整个句子而非在词级别操作的新型 G2P 架构。该架构利用加权同形异义词损失(改善消歧)、运用课程学习(从词级 G2P 逐步切换到句级 G2P),并集成来自 BERT 的词嵌入(以进一步提升性能)。此外,该模型继承了语音识别中的最佳实践,包括与连接主义时序分类(CTC)的多任务学习以及带嵌入式语言模型的束搜索。结果,SoundChoice 在利用 LibriSpeech 和 Wikipedia 数据的整句转写上实现了 2.65% 的音素错误率(PER)。索引词 字素到音素,语音合成,文本到语音,语音学,发音,消歧。

关键词

引用

@article{arxiv.2207.13703,
  title  = {SoundChoice: Grapheme-to-Phoneme Models with Semantic Disambiguation},
  author = {Artem Ploujnikov and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2207.13703},
  year   = {2022}
}

备注

5 pages, submitted to INTERSPEECH 2022