中文

追踪真相:用于视频大语言模型的对象中心时空监控

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

虽然多模态大语言模型 (MLLM) 在视频理解方面取得了进展,但在动态场景中仍高度易产生幻觉。我们认为,这源于时空监控能力的缺失,即在时间维度上持久跟踪对象身份、状态和关系的能力。现有基准通过依赖单一最终答案评估来掩盖这一缺陷,所查询的问题常可通过局部视觉线索或统计先验得到解决。为严格诊断这一问题,我们引入了 STEMO-Bench (时空-对象 MOnitoring),这是一组人工验证的对象中心事实基准,通过分解查询为子问题来评估中间推理,区分真正的时间理解与偶然的正确性。为解决 STEMO 暴露的失败模式,我们提出了 STEMO-Track,一种新型对象中心框架,显式构建和推理结构化对象轨迹,通过块状状态提取和时序聚合实现。大量实验表明,我们的方法显著减少了幻觉答案,提高了时空推理一致性,超越了当前最先进的 MLLM。

关键词

引用

@article{arxiv.2605.08974,
  title  = {Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models},
  author = {Tri Cao and Khoi Le and Thong Nguyen and Cong-Duy Nguyen and Quynh Vo and Anh Tuan Luu and Chunyan Miao and See-Kiong Ng and Shuicheng Yan and Bryan Hooi},
  journal= {arXiv preprint arXiv:2605.08974},
  year   = {2026}
}

备注

Code: https://github.com/nguyentthong/video_hallucination