中文

视频大型多模态模型能否像怀疑者一样思考或坚持原见:关于可撤销视频包含关系的研究

计算机视觉与模式识别 2025-10-08 v2 人工智能 计算与语言

摘要

视频大型多模态模型 (VLMMs) 在理解视频内容方面取得了显著的进展,但它们往往在抽象和自适应推理方面存在挑战——即在新信息出现时修正其解释的能力。现实中,结论几乎总是不确定的;额外的上下文可以加强或削弱初始推断。为此,我们引入了可撤销视频包含关系 (DVidE) 这一新任务,以挑战模型像怀疑者一样思考,持续根据不断变化的证据更新其推理。在 DVidE 中,给定视频前提和文本假设,模型必须确定新的更新是加强还是削弱该假设(分类版本),或生成与加强器或削弱器目标相符的连贯更新以修改包含关系(生成版本)。为解决分类任务,我们提出了反向思维链框架,利用反向事实推理、ASR 增强的视频内容和理由细化以减少推理偏见。对于生成任务,我们开发了一个框架,将 ASR 输出与大型语言模型 (LLM) 组合,以产生与预期的加强器或削弱器目标相符的连贯、上下文相关的更新。此外,我们引入了一个新基准数据集,包含加强器/削弱器标注以及一个专为评估生成性能而设计的 LLM 基于评估指标。实验结果显示,显著的改进,突显我们的方法在增强 VLMMs 动态推理能力方面的作用。

关键词

引用

@article{arxiv.2506.22385,
  title  = {Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment},
  author = {Yue Zhang and Jilei Sun and Yunhui Guo and Vibhav Gogate},
  journal= {arXiv preprint arXiv:2506.22385},
  year   = {2025}
}