用于视听语音分离的深度变分生成模型
音频与语音处理
2021-09-01 v2 机器学习
声音
摘要
本文关注于给定单通道音频录音以及与每位说话人相关的视觉信息(唇部运动)的视听语音分离。我们提出一种基于干净语音视听生成建模的无监督技术。更具体地,在训练期间,使用变分自编码器(VAE)从干净语音谱图中学习潜变量生成模型。为更好地利用视觉信息,潜变量的后验由混合语音(而非干净语音)以及视觉数据推断。视觉模态也通过视觉网络作为潜变量的先验。在测试时,习得的生成模型(含说话人无关与说话人相关两种场景)与用于背景噪声的无监督非负矩阵分解(NMF)方差模型相结合。所有潜变量与噪声参数随后由蒙特卡洛期望最大化算法估计。我们的实验表明,所提出的基于VAE的无监督方法比基于NMF的方法以及一种有监督深度学习技术取得了更好的分离性能。
引用
@article{arxiv.2008.07191,
title = {Deep Variational Generative Models for Audio-visual Speech Separation},
author = {Viet-Nhat Nguyen and Mostafa Sadeghi and Elisa Ricci and Xavier Alameda-Pineda},
journal= {arXiv preprint arXiv:2008.07191},
year = {2021}
}
备注
Accepted to the 31st IEEE International Workshop on Machine Learning for Signal Processing (MLSP), Oct. 25-28, 2021, Gold Coast, Queensland, Australia