VideoDistill:面向视频问答的语言感知视觉蒸馏
计算机视觉与模式识别
2024-04-02 v1
摘要
得益于蓬勃发展的图像-语言预训练框架,视频问答(VideoQA)取得了显著进展。尽管这些图像-语言模型能够高效表示视频和语言分支,但它们通常采用无目标的视觉感知过程,并且在答案生成期间未能很好地将视觉与语言进行交互,从而遗漏了关键的视觉线索。在本文中,我们受人类识别与学习模式的启发,提出了 VideoDistill,一个在视觉感知和答案生成过程中均具备语言感知(即目标驱动)行为的框架。VideoDistill 仅从与问题相关的视觉嵌入中生成答案,并遵循与人类行为高度相似的“思考-观察-回答”方法,这使其有别于以往的研究。具体而言,我们开发了一种语言感知门控机制来替代标准的交叉注意力,避免了语言直接融合到视觉表示中。我们将该机制整合到整个框架的两个关键组件中。第一个组件是可微稀疏采样模块,用于选择包含与问题相关的必要动态和语义的帧。第二个组件是视觉细化模块,它融合了现有的时空注意力层,以确保提取与问题相关的多粒度视觉语义。我们在各种具有挑战性的视频问答基准上进行了实验评估,VideoDistill 在通用和长视频 VideoQA 数据集上均取得了 SOTA 性能。此外,我们验证了 VideoDistill 能够有效缓解 EgoTaskQA 数据集中语言捷径方案的利用。
引用
@article{arxiv.2404.00973,
title = {VideoDistill: Language-aware Vision Distillation for Video Question Answering},
author = {Bo Zou and Chao Yang and Yu Qiao and Chengbin Quan and Youjian Zhao},
journal= {arXiv preprint arXiv:2404.00973},
year = {2024}
}
备注
This paper is accepted by CVPR2024