利用 Grounding DINO 视频中的潜力:面向有限数据场景的参数高效空间时间定位适配
计算机视觉与模式识别
2026-04-15 v1
摘要
空间时间视频定位(STVG)旨在定位查询对象在动态视频片段中的位置。现有完全训练方法数据需求极高。然而,收集大规模 STVG 数据极具挑战性:密集的帧级边界框和复杂的时序语言对齐在标注上昂贵且困难,尤其是针对特定视频领域。因此,传统模型在这些固有有限数据集上容易严重过拟合,而零样例基础模型则缺乏针对精确定位所需的时序意识。为解决此小数据挑战,我们提出了 ST-GD 框架,该框架将预训练的 2D 视觉语言模型(如 Grounding DINO)适配到视频任务。为避免在小数据集上破坏预训练先验,ST-GD 保持基础模型冻结,并 strategically 注入轻量级适配器(约 10M 可训练参数),以注入时空意识,同时引入新颖的时序解码器进行边界预测。此设计自然抵消数据稀缺的影响。因此,ST-GD 在数据稀缺场景下表现出色,在受限规模的 HC-STVG v1/v2 数据集上实现了与竞争方法相当的性能,同时在 VidSTG 数据集上保持稳健的泛化能力。这一结果验证了 ST-GD 作为在严格小数据约束下处理复杂视频理解任务的强大范式。
引用
@article{arxiv.2604.12346,
title = {Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization},
author = {Zanyi Wang and Fan Li and Dengyang Jiang and Liuzhuozheng Li and Yunhua Zhong and Guang Dai and Mengmeng Wang},
journal= {arXiv preprint arXiv:2604.12346},
year = {2026}
}