面向鲁棒视频问答的无干扰嵌入方法
计算机视觉与模式识别
2023-09-04 v1
摘要
生成有效的潜在表示并随后精炼以纳入精确信息,是视频问答(VQA)等视觉-语言理解(VLU)任务的基本前提。然而,多数现有 VLU 方法聚焦于稀疏采样或细化输入信息(例如采样稀疏帧集或文本词元),或添加外部知识。我们提出一种新颖的“DRAX:干扰去除与注意力交叉对齐”方法,以在潜在空间中清除跨模态表示中的干扰项。我们并不排他地限制来自各模态的输入信息感知,而是采用注意力引导的干扰去除方法,以增强潜在嵌入中对任务相关信息的关注。DRAX 还确保跨模态融合时嵌入的语义对齐。我们在具挑战性的基准(SUTD-TrafficQA 数据集)上评估了该方法,通过大量实验检验框架在特征与事件查询、时间关系理解、预测、假设及因果分析上的能力。
引用
@article{arxiv.2309.00133,
title = {Distraction-free Embeddings for Robust VQA},
author = {Atharvan Dogra and Deeksha Varshney and Ashwin Kalyan and Ameet Deshpande and Neeraj Kumar},
journal= {arXiv preprint arXiv:2309.00133},
year = {2023}
}