中文

面向鲁棒视频问答的无干扰嵌入方法

计算机视觉与模式识别 2023-09-04 v1

摘要

生成有效的潜在表示并随后精炼以纳入精确信息,是视频问答(VQA)等视觉-语言理解(VLU)任务的基本前提。然而,多数现有 VLU 方法聚焦于稀疏采样或细化输入信息(例如采样稀疏帧集或文本词元),或添加外部知识。我们提出一种新颖的“DRAX:干扰去除与注意力交叉对齐”方法,以在潜在空间中清除跨模态表示中的干扰项。我们并不排他地限制来自各模态的输入信息感知,而是采用注意力引导的干扰去除方法,以增强潜在嵌入中对任务相关信息的关注。DRAX 还确保跨模态融合时嵌入的语义对齐。我们在具挑战性的基准(SUTD-TrafficQA 数据集)上评估了该方法,通过大量实验检验框架在特征与事件查询、时间关系理解、预测、假设及因果分析上的能力。

关键词

引用

@article{arxiv.2309.00133,
  title  = {Distraction-free Embeddings for Robust VQA},
  author = {Atharvan Dogra and Deeksha Varshney and Ashwin Kalyan and Ameet Deshpande and Neeraj Kumar},
  journal= {arXiv preprint arXiv:2309.00133},
  year   = {2023}
}