中文

面向欠定源分离的广义多通道变分自编码器

机器学习 2018-10-02 v1 机器学习 声音 音频与语音处理

摘要

本文研究欠定条件下的多通道音频源分离问题。多通道非负矩阵分解(MNMF)是一种强有力的方法,它采用 NMF 概念对源功率谱图进行建模。该概念也被用于独立低秩矩阵分析(ILRMA)中,后者是在确定条件下公式化的 MNMF 框架的一个特殊类别。尽管这些方法对特定类型的声源效果相当好,但其一个局限在于,当源谱图不符合 NMF 模型时可能失效。为克服该局限,最近提出了一种称为多通道变分自编码器(MVAE)的 ILRMA 扩展方法,其中使用条件变分自编码器(CVAE)替代 NMF 模型来建模源功率谱图。得益于深度神经网络(DNN)的表示能力,该方法在确定源分离任务中表现优异。原始 MVAE 方法是在确定混合条件下公式化的,本文将其推广以处理欠定情况。我们将所提框架称为广义 MVAE(GMVAE)。所提方法在一个从两个麦克风输入中分离三个源的欠定源分离任务上进行了评估。实验结果表明,GMVAE 方法取得了优于 MNMF 方法的性能。

关键词

引用

@article{arxiv.1810.00223,
  title  = {Generalized Multichannel Variational Autoencoder for Underdetermined Source Separation},
  author = {Shogo Seki and Hirokazu Kameoka and Li Li and Tomoki Toda and Kazuya Takeda},
  journal= {arXiv preprint arXiv:1810.00223},
  year   = {2018}
}