音频如何影响全景视频中的视觉注意力?数据库与模型
计算机视觉与模式识别
2025-05-06 v2
摘要
理解和预测全景视频(ODVs)中观众的注意力对于增强虚拟和增强现实应用中的用户参与度至关重要。尽管音频和视觉两种模态对于ODVs的显著性预测都至关重要,但这两种模态的联合利用仍受限,主要是由于缺乏大规模的音视频显著性数据库和全面分析的结果。本文从主观和客观两个角度全面研究ODVs中的音视频注意力。具体而言,我们首先引入了用于全景视频的新型音视频显著性数据库,称为AVS-ODV数据库,包含162个ODVs,来自60名受试者的眼动数据,受试者在静音、单声道和全向声音三种音频模式下进行测试。基于构建的AVS-ODV数据库,我们对音频如何影响ODVs中的视觉注意力进行深入分析。为推进ODVs音视频显著性预测研究,我们进一步基于AVS-ODV数据库建立了新的基准,通过测试众多最先进的显著性模型,包括视觉单模态模型和音视频模型。在此基础上,鉴于当前模型的局限性,我们提出了一种创新的全景音视频显著性预测网络(OmniAVS),其基于U-Net架构,层次化地融合来自多模态对齐嵌入空间中的音频和视觉特征。大量实验结果表明,所提出的OmniAVS模型在ODVs的音视频预测以及传统音视频预测任务上均优于其他最先进模型。该AVS-ODV数据库和OmniAVS模型将对推动未来研究具有促进作用。
引用
@article{arxiv.2408.05411,
title = {How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model},
author = {Yuxin Zhu and Huiyu Duan and Kaiwei Zhang and Yucheng Zhu and Xilei Zhu and Long Teng and Xiongkuo Min and Guangtao Zhai},
journal= {arXiv preprint arXiv:2408.05411},
year = {2025}
}