基于视频蕴含树推理的常识视频问答
计算机视觉与模式识别
2025-03-26 v2 人工智能
摘要
本文提出了首个基于视频的蕴含树推理方法,用于常识视频问答(VQA)。尽管大型视觉-语言模型(VLM)取得了显著进展,但人们日益担忧它们会学习视频与可能答案之间的虚假相关性,这种担忧因其黑箱性质和持续的基准测试偏差而加剧。我们的方法通过四个步骤将VQA任务显式地锚定到视频片段:蕴含树构建、视频-语言蕴含验证、树推理和动态树扩展。该方法的一个关键优势是其对当前基于视频和图像的VLM在多种推理类型上的泛化能力。为了支持公平评估,我们设计了一种基于大语言模型的去偏程序,该程序重写VQA基准测试的答案集以强制模型进行推理。在现有和去偏基准上的系统实验突显了我们的方法组件在不同基准、VLM和推理类型上的影响。
引用
@article{arxiv.2501.05069,
title = {Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning},
author = {Huabin Liu and Filip Ilievski and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2501.05069},
year = {2025}
}
备注
Accepted by CVPR 2025