中文

CounterVid:用于缓解视频语言模型中动作与时间幻觉的反事实视频生成

计算机视觉与模式识别 2026-01-09 v1 人工智能 计算与语言 多媒体

摘要

视频语言模型实现了强大的多模态理解,但仍然容易产生幻觉,特别是在推理动作和时间顺序时。现有的缓解策略,如文本过滤或随机视频扰动,通常无法解决根本原因:过度依赖语言先验而非细粒度的视觉动态。我们提出了一个可扩展的反事实视频生成框架,该框架合成仅在动作或时间结构上不同但保留场景上下文的视频。我们的流程结合了用于动作提议和编辑指导的多模态 LLM,以及基于扩散的图像和视频模型,以大规模生成语义困难负样本。利用该框架,我们构建了 CounterVid,一个包含约 26k 偏好对的合成数据集,针对动作识别和时间推理。我们进一步引入了 MixDPO,一种联合利用文本和视觉偏好的统一直接偏好优化方法。使用 MixDPO 对 Qwen2.5-VL 进行微调产生了持续的改进,特别是在时间排序方面,并能有效迁移到标准视频幻觉基准测试中。代码和模型将公开发布。

关键词

引用

@article{arxiv.2601.04778,
  title  = {CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models},
  author = {Tobia Poppi and Burak Uzkent and Amanmeet Garg and Lucas Porto and Garin Kessler and Yezhou Yang and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara and Florian Schiffers},
  journal= {arXiv preprint arXiv:2601.04778},
  year   = {2026}
}