CRAFT:针对多模态视频问答的批判性 refined 自适应关键帧目标
计算机视觉与模式识别
2026-05-20 v1 人工智能
摘要
对真实新闻事件进行基于 grounding 的多视频问答需要系统在异构视频档案中 surfacing query相关证据,同时为每个论点归因于其支持来源。我们引入CRAFT(Critic-Refined Adaptive Key-Frame Targeting),一个 query 条件管道,将动态关键帧选择、每个视频的ASR(多语言回退)和批判性循环相结合,以在整合之前不断验证和修复论点。该管道集成了UNLI时间蕴涵、DeBERTa-v3 cross-claim筛选和 Llama-3.2-3B 仲裁员,并包含一个最终的引用合并阶段,为每个事实一次性输出并附带所有支持来源标识符。在MAGMaR 2026上,CRAFT实现了最佳的整体平均值(0.739)、参考召回率(0.810)和引用F1(0.635)。我们进一步评估了MAGMaR风格的WikiVideo转换,包含52个非重叠事件查询,CRAFT也表现良好(0.823平均值),表明其以事实为中心的证据聚合方法超越MAGMaR。消融实验表明,原子事实、ASR和批判性循环是相对于基础 query 条件基线获得主要提升的关键因素。代码和实现细节已公开于 https://github.com/bhosalems/CRAFT。
引用
@article{arxiv.2605.19075,
title = {CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering},
author = {Mahesh Bhosale and Abdul Wasi and Vishvesh Trivedi and Pengyu Yan and Akhil Gorugantu and David Doermann},
journal= {arXiv preprint arXiv:2605.19075},
year = {2026}
}
备注
Accepted at ACL 2026 Multimodal Augmented Generation via MultimodAl Retrieval Workshop