基于时间锚点的 TA-Prompting:增强视频大型语言模型以进行密集视频描述
计算机视觉与模式识别
2026-01-07 v1 人工智能
机器学习
摘要
密集视频描述旨在解释和描述输入视频中所有时序局部化事件。近期的领先方法利用大型语言模型(LLM)为视频数据提供详细的时刻描述。然而,现有的视频LLM在识别未剪辑视频中精确的事件边界方面仍存在挑战,导致生成的描述未能得到正确的 grounding。本文提出了 TA-Prompting,通过时间锚点(Temporal Anchors)增强视频LLM,使其能够精确定位事件并进行时序感知的视频事件理解。在推理过程中,为正确确定来自视频中任意数量事件的输出描述序列,我们引入了事件一致性采样策略,以选择在时序事件之间和跨模态相似性方面具有足够一致性的事件描述。通过在基准数据集上的大量实验,我们展示了我们的 TA-Prompting 在密集视频描述和时序理解任务(包括时刻检索和 temporalQA)方面优于当前领先的视频LLM。
引用
@article{arxiv.2601.02908,
title = {TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors},
author = {Wei-Yuan Cheng and Kai-Po Chang and Chi-Pin Huang and Fu-En Yang and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2601.02908},
year = {2026}
}
备注
8 pages for main paper (exclude citation pages), 6 pages for appendix, totally 10 figures 7 tables and 2 algorithms. The paper is accepted by WACV 2026