混响环境中基于深度生成建模的半监督声源定位
信号处理
2021-04-05 v2 机器学习
声音
音频与语音处理
摘要
我们提出一种基于深度生成建模的混响环境中声源定位半监督方法。混响环境中的定位仍是一个开放挑战。即使数据量很大,混响环境中可用于监督学习的标签数量通常很少。我们通过使用卷积变分自编码器(VAE)对麦克风阵列记录的混响语音信号进行半监督学习(SSL)来解决此问题。该 VAE 被训练以生成麦克风间相对传递函数(RTF)的相位,并行地训练一个基于 RTF 相位的到达方向(DOA)分类器。这些模型使用有标签和无标签的 RTF 相位序列进行训练。在执行这些任务的学习过程中,VAE-SSL 显式地学习将 RTF 相位的物理成因(即声源位置)与噪声和语音活动之类的干扰信号特征分离。相对于声学中现有的半监督定位方法,VAE-SSL 实际上是一种端到端处理方法,仅依赖 RTF 相位特征的最小预处理。据我们所知,我们的论文提出了首个使用深度生成建模对声传播物理建模的方法。VAE-SSL 方法与两种基于信号处理的方法(带相位变换的导向响应功率(SRP-PHAT)和多重信号分类(MUSIC))以及全监督 CNN 进行了比较。我们发现 VAE-SSL 在标签有限场景下优于传统方法和 CNN。此外,训练好的 VAE-SSL 系统可生成新的 RTF 相位样本,这表明 VAE-SSL 方法学习了声学环境的物理。因此,VAE-SSL 中的生成建模提供了一种解释所学表示的方式。
引用
@article{arxiv.2101.10636,
title = {Semi-supervised source localization in reverberant environments with deep generative modeling},
author = {Michael J. Bianco and Sharon Gannot and Efren Fernandez-Grande and Peter Gerstoft},
journal= {arXiv preprint arXiv:2101.10636},
year = {2021}
}
备注
Revision, submitted to IEEE Access