中文

面向视频问答的冗余感知 Transformer

计算机视觉与模式识别 2023-08-08 v1 人工智能

摘要

本文指出了当前 VideoQA 范式中的两类冗余。具体而言,当前的视频编码器倾向于以分层方式在不同粒度上整体嵌入所有视频线索,这不可避免地引入了\textit{邻帧冗余},可能淹没对象级别的细节视觉线索。随后,主流的视觉-语言融合设计通过将所有视觉元素与问题词元无差别地穷尽融合,引入了\textit{跨模态冗余},未显式区分其成对的视觉-语言交互,从而对作答产生有害影响。为此,我们提出一种新颖的基于 transformer 的架构,旨在以冗余感知的方式建模 VideoQA。为处理邻帧冗余,我们引入一种视频编码器结构,强调邻帧间对象级变化,同时采用邻域外消息传递方案,仅对远距离帧施加注意力。至于跨模态冗余,我们为融合模块配备一种新颖的自适应采样,通过识别一小部分专门支撑答案的视觉元素来显式区分视觉-语言交互。基于这些进展,我们发现该\underline{R}edundancy-\underline{a}ware trans\underline{former} (RaFormer) 能在多个 VideoQA 基准上取得最先进结果。

关键词

引用

@article{arxiv.2308.03267,
  title  = {Redundancy-aware Transformer for Video Question Answering},
  author = {Yicong Li and Xun Yang and An Zhang and Chun Feng and Xiang Wang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2308.03267},
  year   = {2023}
}

备注

Accepted to ACM MM23