中文

通过单环与双环多模态链框架为ASR和TTS增强图像

计算与语言 2020-11-05 v1 声音 音频与语音处理

摘要

先前的研究提出了一种机器语音链,使自动语音识别(ASR)和文本到语音合成(TTS)在半监督学习中相互辅助,并避免需要大量配对的语音和文本数据。然而,该框架仍需要大量未配对(语音或文本)数据。随后探索了一种原型多模态机器链,以进一步减少对大量未配对数据的需求,即使不再有语音或文本数据可用时也能改进ASR或TTS。遗憾的是,该框架依赖于图像检索(IR)模型,因此仅限于处理训练期间已见过的那些图像。此外,该框架的性能仅在单说话人人工语音数据上进行了研究。在本研究中,我们利用图像生成(IG)改进多模态机器链框架,并探究在多人自然语音数据上使用单环和双环架构为ASR和TTS增强图像数据的可能性。实验结果表明,单环和双环多模态链框架均能利用仅含图像的数据集使ASR和TTS提升其性能。

关键词

引用

@article{arxiv.2011.02099,
  title  = {Augmenting Images for ASR and TTS through Single-loop and Dual-loop Multimodal Chain Framework},
  author = {Johanes Effendi and Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
  journal= {arXiv preprint arXiv:2011.02099},
  year   = {2020}
}

备注

Accepted at INTERSPEECH 2020