何时何物:基于实体感知分段的扩散驱动视频 LLM用于长视频理解
计算机视觉与模式识别
2025-08-22 v1
摘要
视频理解不仅需要回答开放式问题,还需要能够定位事件发生的时间以及跨时间实体之间的相互作用。虽然最近的视频 LLM 在整体推理方面取得了显著进展,但在时间感知方面仍显粗糙:时间戳仅被隐式编码,帧级特征在捕捉连续性方面较弱,语言-视觉对齐常常偏离感兴趣的实体。本文提出了 Grounded VideoDiT,一种为克服这些限制而设计的视频 LLM,引入了三个关键创新。首先,扩散时间潜在(DTL)编码器增强了边界敏感性并保持时间一致性。其次,基于对象的表示显式地将查询实体绑定到局部视觉证据,从而加强了对齐。最后,混合 token 方案引入离散时间 token,实现了显式的时间戳建模,使细粒度的时间推理成为可能。总体而言,这些设计使 Grounded VideoDiT 具备了强大的 grounding 能力,经过在 Charades STA、NExT GQA 以及多个 VideoQA 基准测试的验证,显示出业界最先进的性能。
引用
@article{arxiv.2508.15641,
title = {When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding},
author = {Pengcheng Fang and Yuxia Chen and Rui Guo},
journal= {arXiv preprint arXiv:2508.15641},
year = {2025}
}