以自我为中心的深层多通道音视频主动说话人定位
计算机视觉与模式识别
2022-01-07 v1 声音
音频与语音处理
摘要
增强现实设备有潜力增强人类感知,并在复杂对话环境中实现其他辅助功能。有效捕获理解这些社交互动所需的音视频上下文,首先需要检测并定位设备佩戴者及周围人群的语音活动。这些任务因其以自我为中心的特性而具挑战性:佩戴者的头部运动可能导致运动模糊,周围人群可能出现在困难视角,并可能存在遮挡、视觉杂乱、音频噪声与不良光照。在这些条件下,先前最先进的主动说话人检测方法无法给出满意结果。相反,我们利用视频与多通道麦克风阵列音频,从一新设定处理该问题。我们提出一种新颖的端到端深度学习方法,能够给出鲁棒的语音活动检测与定位结果。与先前方法不同,我们的方法在球面上所有可能方向定位主动说话人,即便在相机视场之外,同时检测设备佩戴者自身的语音活动。我们的实验表明,所提方法给出更优结果,可实时运行,并对噪声与杂乱具有鲁棒性。
引用
@article{arxiv.2201.01928,
title = {Egocentric Deep Multi-Channel Audio-Visual Active Speaker Localization},
author = {Hao Jiang and Calvin Murdock and Vamsi Krishna Ithapu},
journal= {arXiv preprint arXiv:2201.01928},
year = {2022}
}