面向音视频问答的渐进式时空感知方法
计算机视觉与模式识别
2023-08-11 v1 多媒体
摘要
音视频问答(AVQA)任务旨在回答关于视频中不同视觉对象、声音及其关联的问题。此类天然多模态视频由丰富而复杂的动态音视频成分组成,其中大多数可能与给定问题无关,甚至作为干扰影响对感兴趣内容的解答。相反,仅关注与问题相关的音视频内容可摆脱干扰,同时使模型更高效地作答。本文提出一种渐进式时空感知网络(PSTP-Net),包含三个逐步识别与问题相关的关键时空区域的模块。具体而言,首先引入时间片段选择模块以筛选与给定问题最相关的音视频片段;随后利用空间区域选择模块从所选时间片段中挑选与问题最相关的区域;为进一步精炼特征选择,采用音频引导的视觉注意力模块感知音频与所选空间区域间的关联;最后整合这些模块的时空特征以回答问题。在公开数据集 MUSIC-AVQA 和 AVQA 上的大量实验结果有力证明了 PSTP-Net 的有效性与高效性。代码见:\href{https://github.com/GeWu-Lab/PSTP-Net}{https://github.com/GeWu-Lab/PSTP-Net}
引用
@article{arxiv.2308.05421,
title = {Progressive Spatio-temporal Perception for Audio-Visual Question Answering},
author = {Guangyao Li and Wenxuan Hou and Di Hu},
journal= {arXiv preprint arXiv:2308.05421},
year = {2023}
}
备注
Accepted by ACM MM 2023