利用对象锚定提升面向时间敏感视频理解的大语言模型能力
计算机视觉与模式识别
2025-12-10 v2
摘要
我们提出通过引入帧内锚定对象(grounded objects, GO)来提升视频大语言模型(Video-LLM)在时间敏感视频理解(time-sensitive video understanding, TSV)方面的能力。我们假设,TSV 任务能够从帧内的锚定对象中受益,这一假设通过在 LITA—a 用于推理时序局部化的最先进 Video-LLM 的初步实验得以支持。虽然通过在提示中加入这些对象注释的文本描述会提高 LITA 的性能,但也会引入额外的 token 长度以及对对象级信息噪声的敏感性。为此,我们提出了 GO-Tokenizer,一个轻量级的 Video-LLM 附加模块,利用即插即用的对象检测器对即时的紧凑对象信息进行编码。实验结果表明,使用 GO-Tokenizer 进行的预训练性能优于基础 Video-LLM 以及使用文本描述对象提示的等价方法。该提升在不同模型、数据集和视频理解任务(如时序局部化推理和密集描述)上均得到验证。
引用
@article{arxiv.2509.06335,
title = {Harnessing Object Grounding for Time-Sensitive Video Understanding},
author = {Tz-Ying Wu and Sharath Nittur Sridhar and Subarna Tripathi},
journal= {arXiv preprint arXiv:2509.06335},
year = {2025}
}
备注
Accepted to WACV 2026