解耦语音与非语音成分以从海量网络数据构建鲁棒声学模型
音频与语音处理
2019-09-27 v1 机器学习
声音
机器学习
摘要
为了为大多数语言构建语言技术,利用互联网公共领域可用的资源(通常称为“Found Data”(海量网络数据))十分重要。然而,此类数据的特征在于存在非标准、非平凡的变化。例如,互联网上的语音资源含有非语音内容,如音乐。因此,语音识别和语音合成模型需要对这类变化具有鲁棒性。在本工作中,我们提出一项分析以表明,解耦原始数据中变化的潜在因果因素对于完成这些任务十分重要。基于此,我们提出使用隐随机模型从数据中解耦此类变化的方法。具体而言,我们提出一种方法,将隐先验空间拆分为音频信号幅度谱中主导语音模式的连续表示。我们提出一种完全无监督的方法,使用多节点隐空间变分自编码器(VAE)。我们表明,VAE 隐空间上的约束实际上可用于分离语音和音乐,且与语音语言无关。本文还解析地给出了基于语音数据分布的该任务所需隐变量数量的要求。
引用
@article{arxiv.1909.11727,
title = {Disentangling Speech and Non-Speech Components for Building Robust Acoustic Models from Found Data},
author = {Nishant Gurunath and Sai Krishna Rallabandi and Alan Black},
journal= {arXiv preprint arXiv:1909.11727},
year = {2019}
}