中文

面向空间感知场景分解的深度张量分解

声音 2019-09-30 v2 机器学习 音频与语音处理 机器学习

摘要

我们提出一种完全无监督的方法,通过将给定的场景分解为各个组成声源及其在每个麦克风中的相对存在,来理解由随机麦克风阵列观测到的音频场景。为此,我们构建了一种可解释为多通道音频记录的非负张量分解的神经网络架构。通过对对应于通道内容的所学网络参数进行聚类,我们可以学习到声源各自的频谱字典及其随时间变化的激活模式。我们的方法使我们能够利用端到端训练等深度学习进展,同时也支持随机小批量训练,从而能够切实分解使用标准方法难以处理的实际音频场景。该神经网络架构易于扩展到其他类型的张量分解。

关键词

引用

@article{arxiv.1905.01391,
  title  = {Deep Tensor Factorization for Spatially-Aware Scene Decomposition},
  author = {Jonah Casebeer and Michael Colomb and Paris Smaragdis},
  journal= {arXiv preprint arXiv:1905.01391},
  year   = {2019}
}

备注

5 pages, 5 figures, accepted to WASPAA 2019