AV-Gaze:音频引导的视觉注意力估计对非正面人脸的有效性研究
计算机视觉与模式识别
2022-08-15 v2
摘要
在极端头部姿态、遮挡和低分辨率图像等具有挑战性的现实条件下,视觉信息难以估计视觉注意力/注视方向,而音频信号可以提供重要且互补的信息。本文探讨了音频引导的粗略头部姿态是否能进一步提升非正面人脸的视觉注意力估计性能。由于为估计说话者头部姿态而标注音频信号较为困难,我们使用现成的最先进模型来促进跨模态弱监督。在训练阶段,该框架从同步的音视频模态中学习互补信息。我们的模型可以利用任何可用的模态(即音频、视觉或音视频)进行特定任务的推理。值得注意的是,当AV-Gaze在基准数据集上使用这些特定模态进行测试时,它在多个数据集上取得了有竞争力的结果,同时对具有挑战性的场景表现出高度的适应性。
引用
@article{arxiv.2207.03048,
title = {AV-Gaze: A Study on the Effectiveness of Audio Guided Visual Attention Estimation for Non-Profilic Faces},
author = {Shreya Ghosh and Abhinav Dhall and Munawar Hayat and Jarrod Knibbe},
journal= {arXiv preprint arXiv:2207.03048},
year = {2022}
}