基于帧评分机制和自适应抽样的端到端视频问答
计算机视觉与模式识别
2024-07-24 v2 计算与语言
摘要
视频问答(VideoQA)已成为多媒体处理领域的具有挑战性的前沿,要求视觉与文本模态之间进行复杂的交互。仅均匀抽取帧或不加区分地聚合帧级视觉特征,往往难以捕捉视频中细致且相关的上下文,以实现良好的 VideoQA 性能。为缓解此问题,我们提出VidF4,一个配备量身化帧选择策略的新型 VideoQA 框架,以实现高效且有效的 VideoQA。我们提出三种帧评分机制,考虑问题相关性和帧间相似性,以评估给定问题下每个帧的重要性。此外,我们设计了一种可微自适应帧抽样机制,以便于帧选择器和答案生成器的端到端训练。实验结果在三个广泛采用的基准数据集上表明,我们的模型在现有 VideoQA 方法中持续表现优异,分别在 NExT-QA 上超越 0.3%,在 STAR 上超越 0.9%,在 TVQA 上超越 1.0%,树立了新的 SOTA。此外,通过定性和定量分析,我们验证了每项设计选择的有效性。
引用
@article{arxiv.2407.15047,
title = {End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling},
author = {Jianxin Liang and Xiaojun Meng and Yueqian Wang and Chang Liu and Qun Liu and Dongyan Zhao},
journal= {arXiv preprint arXiv:2407.15047},
year = {2024}
}