基于全卷积网络的动态多说话人定位方法
音频与语音处理
2020-08-28 v1 机器学习
声音
摘要
本文提出一种基于深度神经网络的在线多说话人定位算法。遵循谱域中的 W-不相交正交性原理,每个时频(TF)单元由单一说话人、从而由单一到达方向(DOA)主导。训练一个全卷积网络,利用瞬时空间特征估计每个 TF 单元的 DOA。高分辨率分类使网络能够准确且同时定位并跟踪多个说话人,包括静态与动态。使用静态与动态场景下模拟及真实录音的详尽实验研究证实,所提算法优于经典及近期基于深度学习的算法。
引用
@article{arxiv.2008.11845,
title = {FCN Approach for Dynamically Locating Multiple Speakers},
author = {Hodaya Hammer and Shlomo E. Chazan and Jacob Goldberger and Sharon Gannot},
journal= {arXiv preprint arXiv:2008.11845},
year = {2020}
}