多人脸视频上视觉-音频显著性预测与声源定位的联合学习
计算机视觉与模式识别
2021-11-17 v1
摘要
视觉与音频事件同时发生且均吸引注意。然而,大多数现有显著性预测工作忽略音频影响,仅考虑视觉模态。本文提出一种利用视觉、音频和人脸信息在多人脸视频上进行视觉-音频显著性预测与声源定位的多任务学习方法。具体而言,我们首先引入一个视觉-音频条件下的多人脸视频大规模数据库(MVVA),包含眼动追踪数据与声源标注。利用该数据库,我们发现声音影响人类注意,反之注意为确定多人脸视频上声源提供线索。受这些发现引导,引入视觉-音频多任务网络(VAM-Net)来预测显著性与定位声源。VAM-Net 由对应视觉、音频和人脸模态的三个分支组成。视觉分支具有双流架构以捕获空间与时间信息。人脸与音频分支分别编码音频信号与人脸。最后,构建时空多模态图(STMG)以建模多个人脸间的交互。通过这些分支的联合优化,利用了显著性预测与声源定位任务间的内在关联,并相互提升性能。实验表明,所提方法优于 12 种最先进显著性预测方法,并在声源定位中取得有竞争力的结果。
引用
@article{arxiv.2111.08567,
title = {Joint Learning of Visual-Audio Saliency Prediction and Sound Source Localization on Multi-face Videos},
author = {Minglang Qiao and Yufan Liu and Mai Xu and Xin Deng and Bing Li and Weiming Hu and Ali Borji},
journal= {arXiv preprint arXiv:2111.08567},
year = {2021}
}
备注
21 pages, 15 figures