利用生物/心理学驱动的神经网络模块探索无文本语音合成(ZeroSpeech 2020)
计算与语言
2020-11-03 v3 机器学习
声音
音频与语音处理
摘要
在本研究中,我们报告了在 2020 零资源语音挑战赛中对于无文本语音合成(TTS without T)的探索,在该挑战赛中参与者提出了一个端到端、无监督的系统,可同时学习语音识别与 TTS。我们采用受生物/心理启发的神经网络(ANN)模块应对该挑战,特别关注将人类语言的无监督学习视为一个生物/心理问题。系统首先用回声状态网络(ESN)处理梅尔频率倒谱系数(MFCC)帧,并模拟皮层微环路中的计算。处理结果由我们原创的变分自编码器(VAE)离散化,该自编码器实现了计算语言学与认知科学中广泛接受的基于狄利克雷的贝叶斯聚类。离散化信号随后通过语音产生的源-滤波器模型的神经网络实现还原为声音波形。
引用
@article{arxiv.2005.05487,
title = {Exploring TTS without T Using Biologically/Psychologically Motivated Neural Network Modules (ZeroSpeech 2020)},
author = {Takashi Morita and Hiroki Koda},
journal= {arXiv preprint arXiv:2005.05487},
year = {2020}
}
备注
Accepted in INTERSPEECH 2020