应用于视听语音增强的变分自编码器解耦学习
音频与语音处理
2022-01-04 v2 机器学习
声音
摘要
近来,标准变分自编码器已成功用于学习语音信号上的概率先验,随后被用于执行语音增强。此后,变分自编码器以描述高层语音属性(例如语音活动)的标签为条件,从而实现对语音生成的更显式控制。然而,该标签并不能保证与其他潜变量解耦,这导致相较于标准变分自编码器性能提升有限。在本工作中,我们提出使用一种针对变分自编码器的对抗训练方案,以将标签与其他潜变量解耦。在训练时,我们使用一个与变分自编码器的编码器竞争的判别器。同时,我们还使用了一个额外的编码器为变分自编码器的解码器估计标签,这被证明对学习解耦至关重要。我们展示了当利用从视觉数据估计的语音活动标签进行语音增强时,所提出的解耦学习的益处。
引用
@article{arxiv.2105.08970,
title = {Disentanglement Learning for Variational Autoencoders Applied to Audio-Visual Speech Enhancement},
author = {Guillaume Carbajal and Julius Richter and Timo Gerkmann},
journal= {arXiv preprint arXiv:2105.08970},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2102.06454