集成音视频信号与空间查询机制的实时活跃说话人检测系统
音频与语音处理
2023-09-18 v1 计算机视觉与模式识别
机器学习
声音
摘要
我们介绍了一种独特的实时、因果、基于神经网络的活跃说话人检测系统,针对低功耗边缘计算优化。该系统驱动虚拟摄像模块,并已部署于商用设备。系统使用来自麦克风阵列和 360 度摄像头的数据。对于一场有 14 名参与者的会议,我们的网络每位参与者仅需 127 MFLOPs。与以往工作不同,我们考察了在网络计算预算耗尽时的错误率,发现其表现出优雅退化,使系统即便在此情况下也能合理运行。不同于传统的波达方向(DOA)估计方法,我们的网络学习在考虑检测到头部位置的情况下查询可用的声学数据。我们在包含同一会议中多达 14 名参与者、重叠语音及其他挑战性场景的真实会议数据集上训练和评估了我们的算法。
引用
@article{arxiv.2309.08295,
title = {A Real-Time Active Speaker Detection System Integrating an Audio-Visual Signal with a Spatial Querying Mechanism},
author = {Ilya Gurvich and Ido Leichter and Dharmendar Reddy Palle and Yossi Asher and Alon Vinnikov and Igor Abramovski and Vishak Gopal and Ross Cutler and Eyal Krupka},
journal= {arXiv preprint arXiv:2309.08295},
year = {2023}
}