中文

CCTVBench:面向多模态大语言模型的对比一致性交通视频问答基准

计算机视觉与模式识别 2026-04-23 v1

摘要

安全关键的交通推理需要对比一致性:模型必须在事故发生时检测到真实危险,并在近乎相同的反事实场景下可靠地拒绝看似合理但错误的假设。我们提出了 CCTVBench,一个对比一致性交通视频问答基准,它建立在成对的真实事故视频与世界模型生成的反事实对应视频之上,并配有差异极小、互斥的假设性问题。CCTVBench 对每个视频问题四元组强制执行单一结构化决策模式,并提供可操作的诊断,将失败分解为正遗漏、正交换、负幻觉和互斥性违反,同时分离了视频一致性与问题一致性。跨开源和闭源视频大语言模型的实验揭示,标准的逐实例问答指标与四元组级别的对比一致性之间存在巨大且持久的差距,其中不可靠的“以上皆非”拒绝是一个关键瓶颈。最后,我们引入了 C-TCD,一种对比解码方法,在推理时利用语义互斥的对应视频作为对比输入,同时提升了实例级问答和对比一致性。

关键词

引用

@article{arxiv.2604.20460,
  title  = {CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs},
  author = {Xingcheng Zhou and Hao Guo and Rui Song and Walter Zimmer and Mingyu Liu and André Schamschurko and Hu Cao and Alois Knoll},
  journal= {arXiv preprint arXiv:2604.20460},
  year   = {2026}
}