中文

基于全卷积网络的动态多说话人定位方法

音频与语音处理 2020-08-28 v1 机器学习 声音

摘要

本文提出一种基于深度神经网络的在线多说话人定位算法。遵循谱域中的 W-不相交正交性原理,每个时频(TF)单元由单一说话人、从而由单一到达方向(DOA)主导。训练一个全卷积网络,利用瞬时空间特征估计每个 TF 单元的 DOA。高分辨率分类使网络能够准确且同时定位并跟踪多个说话人,包括静态与动态。使用静态与动态场景下模拟及真实录音的详尽实验研究证实,所提算法优于经典及近期基于深度学习的算法。

关键词

引用

@article{arxiv.2008.11845,
  title  = {FCN Approach for Dynamically Locating Multiple Speakers},
  author = {Hodaya Hammer and Shlomo E. Chazan and Jacob Goldberger and Sharon Gannot},
  journal= {arXiv preprint arXiv:2008.11845},
  year   = {2020}
}