基于音视觉融合机制的多目标波达方向估计
声音
2021-05-14 v1 机器人学
音频与语音处理
摘要
先前在空间波达方向(DoA)领域的研究大多聚焦于单一模态。然而,人类利用听觉与视觉感官来察觉声源的存在。受此启发,我们提出使用带有音频与视频信号的神经网络进行多说话人定位。异构传感器的使用可提供互补信息,以克服单模态所面临的噪声、混响、光照变化与遮挡等挑战。我们尝试通过引入一种用于音视觉融合的自适应加权机制来解决这些问题。我们还提出了一种新颖的视频仿真方法,可从含噪目标三维标注中生成与声学特征同步的视觉特征。实验结果证实,音视觉融合持续提升了说话人DoA估计的性能,而自适应加权机制则展现出明显的益处。
引用
@article{arxiv.2105.06107,
title = {Multi-target DoA Estimation with an Audio-visual Fusion Mechanism},
author = {Xinyuan Qian and Maulik Madhavi and Zexu Pan and Jiadong Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2105.06107},
year = {2021}
}
备注
ICASSP 2021 accepted