OmniGround:面向真实复杂场景的全时空 grounding 基准
计算机视觉与模式识别
2025-11-24 v1 人工智能
摘要
时空视频 grounding (STVG) 旨在基于自然语言描述在视频中定位目标对象。尽管近期在多模态大语言模型方面取得了进展,但当前模型与真实需求之间仍存在显著差距,后者涉及多样化对象和复杂查询。我们将其归因于基准范围有限,导致模型出现类别偏见、推理过于简化以及语言鲁棒性差。为此,我们引入 OmniGround,一个包含 3,475 个视频、覆盖 81 个类别并涉及复杂真实查询的全面基准。我们提出 Forward-Backward-Refinement 标注流程,将多方向跟踪与智能错误纠正相结合,以获得高质量标签。我们进一步引入 DeepSTG,一个系统性评估框架,从四个互补维度(超出表面统计) 量化数据集质量。评估显示,在复杂真实场景中的性能平均下降 10.4%,尤其在小目标/遮挡对象和复杂空间关系方面表现明显。针对此现象,我们提出 PG-TAF,一个无训练的两阶段框架,将 STVG 分解为高层时序 grounding 和细粒度时空传播。实验表明,PG-TAF 在 OmniGround 上在 m_tIoU 和 m_vIoU 上分别实现 25.6% 和 35.6% 的提升,并在四个基准上保持一致收益。
关键词
引用
@article{arxiv.2511.16937,
title = {OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios},
author = {Hong Gao and Jingyu Wu and Xiangkai Xu and Kangni Xie and Yunchen Zhang and Bin Zhong and Xurui Gao and Min-Ling Zhang},
journal= {arXiv preprint arXiv:2511.16937},
year = {2025}
}
备注
20 pages