中文

VITED:视频时间证据蒸馏

计算机视觉与模式识别 2025-03-18 v1 人工智能 计算与语言

摘要

我们检验通过链式证据推理进行复杂视频问答——从多个相关视频片段中识别时间序列跨度,并从中提取视觉证据。现有模型在多步骤推理方面困难,因为它们均匀采样固定数量的帧,这可能会遗漏视频中分布不均的关键证据。此外,它们缺乏在整个视频背景下对证据进行时间局部化的能力,这是回答复杂问题所必需的。我们提出了一个框架,通过搜索视频中最佳感兴趣区间来自动构建支持证据的证据推理链,从而最大化回答给定问题的可能性。我们训练我们的模型(VITED)直接生成这些证据链,使其既能局部化证据窗口,又能在长视频内容中跨证据进行多步骤推理。我们在一套长视频 QA 基准测试上展示了我们证据蒸馏模型的价值,该模型在缺乏证据推理能力的 SOTA 方法之上取得优势。

关键词

引用

@article{arxiv.2503.12855,
  title  = {VITED: Video Temporal Evidence Distillation},
  author = {Yujie Lu and Yale Song and William Wang and Lorenzo Torresani and Tushar Nagarajan},
  journal= {arXiv preprint arXiv:2503.12855},
  year   = {2025}
}