利用视觉监督进行基于阵列的活跃说话人检测与定位
音频与语音处理
2023-12-22 v1 机器学习
声音
图像与视频处理
信号处理
摘要
传统的活跃说话人检测 (ASD) 视听方法通常依赖于视觉预提取的人脸轨迹及其对应的单声道音频来定位视频中的说话人。因此,一旦说话人的面部不可见,这些方法往往会失效。我们证明,一个简单的音频卷积循环神经网络 (CRNN),利用从多通道音频中提取的空间输入特征进行训练,可以独立于视觉模态执行同步的水平活跃说话人检测与定位 (ASDL)。为解决生成此类系统训练所需真值标签的时间和成本问题,我们提出了一种新的自监督训练流程,该流程采用“学生 - 教师”学习方法。我们采用一个传统的预训练活跃说话人检测器作为“教师”网络,以提供说话人位置作为伪标签。多通道音频“学生”网络被训练以生成相同的结果。在推理阶段,学生网络能够泛化并定位教师网络无法通过视觉检测到的被遮挡说话人,从而显著提高召回率。在 TragicTalkers 数据集上的实验表明,采用所提出的自监督学习方法训练的音频网络,其性能可以超越典型的视听方法,并产生与昂贵的传统监督训练相媲美的结果。我们证明,在学习流程中引入最少的人工监督即可实现性能提升。通过扩大训练集并将视觉与多通道音频系统集成,有望获得进一步的增益。
引用
@article{arxiv.2312.14021,
title = {Leveraging Visual Supervision for Array-based Active Speaker Detection and Localization},
author = {Davide Berghi and Philip J. B. Jackson},
journal= {arXiv preprint arXiv:2312.14021},
year = {2023}
}