基于动态音视频场景问答的目标感知时空推理
计算机视觉与模式识别
2023-12-11 v2
摘要
音视频问答(AVQA)是一项极具挑战性的任务,需要对多模态上下文进行多步时空推理。近期工作依赖于对音视频场景精细的、与目标无关的分析来进行空间定位,同时将音频与视频作为独立实体处理以进行时间定位。本文提出一种用于AVQA的新颖目标感知联合时空定位网络。其包含两个关键组件:目标感知空间定位模块(TSG)与单流联合音视频时间定位模块(JTG)。TSG能够利用来自问题的显式语义,聚焦于与查询主体相关的音视频线索。不同于以往需要额外音视频融合模块的双流时间定位模块,JTG将音视频融合与问题感知的时间定位整合进一个更简单的单流架构模块中。JTG中音频与视频的时间同步由我们提出的跨模态同步损失(CSL)促进。大量实验验证了所提方法相对于现有最优方法的有效性。
引用
@article{arxiv.2305.12397,
title = {Target-Aware Spatio-Temporal Reasoning via Answering Questions in Dynamics Audio-Visual Scenarios},
author = {Yuanyuan Jiang and Jianqin Yin},
journal= {arXiv preprint arXiv:2305.12397},
year = {2023}
}
备注
Accepted to EMNLP 2023 Findings