视频对齐与答案聚合:用于视频问答的组合推理
计算机视觉与模式识别
2024-07-04 v1
摘要
尽管近期在视频问答(VideoQA)方面取得了进展,但这些方法通常作为黑箱工作,难以理解其推理过程并进行一致的组合推理。为此,我们提出了一个模型无关的视频对齐与答案聚合(VA)框架,能够通过集成视频对齐器和答案聚合器模块来增强现有VidQA方法的组合一致性和准确性。视频对齐器基于问题层次化选择相关视频片段,而答案聚合器则基于其子问题进行推理,通过问题分解图上的信息流和对比学习策略确保组合一致性。我们在三个AGQA-Decomp数据集的三个设置下评估了我们的框架,并提出了新的指标来更全面地衡量VidQA方法的组合一致性。此外,我们提出了一个基于大型语言模型(LLM)的自动问题分解管道,将我们的框架应用于任何VidQA数据集。我们将MSVD和NExT-QA数据集扩展以评估VA框架在更广泛场景中的应用。大量实验表明,我们的框架显著提高了现有方法的组合一致性和准确性,导致更具可解释性的实际VidQA模型。
关键词
引用
@article{arxiv.2407.03008,
title = {Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering},
author = {Zhaohe Liao and Jiangtong Li and Li Niu and Liqing Zhang},
journal= {arXiv preprint arXiv:2407.03008},
year = {2024}
}
备注
10 pages,CVPR