通过单环与双环多模态链框架为ASR和TTS增强图像
计算与语言
2020-11-05 v1 声音
音频与语音处理
摘要
先前的研究提出了一种机器语音链,使自动语音识别(ASR)和文本到语音合成(TTS)在半监督学习中相互辅助,并避免需要大量配对的语音和文本数据。然而,该框架仍需要大量未配对(语音或文本)数据。随后探索了一种原型多模态机器链,以进一步减少对大量未配对数据的需求,即使不再有语音或文本数据可用时也能改进ASR或TTS。遗憾的是,该框架依赖于图像检索(IR)模型,因此仅限于处理训练期间已见过的那些图像。此外,该框架的性能仅在单说话人人工语音数据上进行了研究。在本研究中,我们利用图像生成(IG)改进多模态机器链框架,并探究在多人自然语音数据上使用单环和双环架构为ASR和TTS增强图像数据的可能性。实验结果表明,单环和双环多模态链框架均能利用仅含图像的数据集使ASR和TTS提升其性能。
引用
@article{arxiv.2011.02099,
title = {Augmenting Images for ASR and TTS through Single-loop and Dual-loop Multimodal Chain Framework},
author = {Johanes Effendi and Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2011.02099},
year = {2020}
}
备注
Accepted at INTERSPEECH 2020