基于深度生成建模的半监督声源定位
音频与语音处理
2021-02-15 v3 机器学习
声音
信号处理
摘要
我们提出了一种基于变分自编码器(VAEs)深度生成建模的半监督定位方法。在混响环境中的定位仍然是一项挑战,机器学习(ML)已显示出解决该问题的潜力。即便数据量很大,混响环境中可用于监督学习的标签数量通常很少。我们通过使用卷积VAE进行半监督学习(SSL)来解决此问题。该VAE在有标签和无标签的RTF样本上,并行地生成相对传递函数(RTFs)的相位以及训练一个DOA分类器。我们将VAE-SSL方法与SRP-PHAT和全监督CNN进行了比较。我们发现,在标签有限的场景下,VAE-SSL可以优于SRP-PHAT和CNN。
引用
@article{arxiv.2005.13163,
title = {Semi-supervised source localization with deep generative modeling},
author = {Michael J. Bianco and Sharon Gannot and Peter Gerstoft},
journal= {arXiv preprint arXiv:2005.13163},
year = {2021}
}
备注
Published in proceedings of IEEE International Workshop on Machine Learning for Signal Processing. arXiv admin note: substantial text overlap with arXiv:2101.10636