UniCon:用于鲁棒主动说话人检测的统一上下文网络
计算机视觉与模式识别
2021-08-06 v1 多媒体
声音
音频与语音处理
图像与视频处理
摘要
我们提出了一种用于鲁棒主动说话人检测(ASD)的新型高效框架——统一上下文网络(UniCon)。传统的 ASD 方法通常分别对每位候选人的预裁剪人脸轨迹进行处理,未能充分考虑候选者之间的关系。这可能会限制性能,尤其是在低分辨率人脸、多名候选人等具有挑战性的场景中。我们的方案是一种新颖的统一框架,侧重于联合建模多种类型的上下文信息:指示每位候选人人脸位置与尺度的空间上下文,捕捉候选人之间视觉关系并相互对比音视频亲和力的关系上下文,以及聚合长期信息并平滑局部不确定性的时间上下文。基于此类信息,我们的模型在统一过程中优化所有候选人,以实现鲁棒可靠的 ASD。我们在多个具有挑战性的 ASD 基准上针对不同设置进行了详尽的消融研究。特别地,我们的方法在三个候选说话人的子集和人脸小于 64 像素的另一个具有挑战性的子集上,以约 15% 平均精度均值(mAP)绝对值的较大优势超越了最先进水平。总之,我们的 UniCon 在 AVA-ActiveSpeaker 验证集上取得了 92.0% 的 mAP,在提交时首次在该具有挑战性的数据集上超越 90%。项目网站:https://unicon-asd.github.io/。
引用
@article{arxiv.2108.02607,
title = {UniCon: Unified Context Network for Robust Active Speaker Detection},
author = {Yuanhang Zhang and Susan Liang and Shuang Yang and Xiao Liu and Zhongqin Wu and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2108.02607},
year = {2021}
}
备注
10 pages, 6 figures; to appear at ACM Multimedia 2021