TRACE:基于因果事件建模的视频时间基 grounding LLM
计算机视觉与模式识别
2025-03-04 v3
摘要
视频时间基 grounding(VTG)是视频理解模型的关键能力,在诸如视频浏览和编辑等下游任务中发挥着重要作用。为了同时处理各种任务并实现零样本预测,越来越多地采用视频 LLM 用于 VTG 任务。然而,当前的视频 LLM 方法仅依赖自然语言生成,缺乏对视频固有结构的建模能力,限制了其在解决 VTG 任务方面的效果。为此,本文首先正式引入因果事件建模框架,将视频 LLM 输出表示为事件序列,并使用前置事件、视频输入和文本指令预测当前事件。每个事件由时间戳、显著性得分和文本描述三个组成部分构成。随后,我们提出了名为 TRACE 的新型任务交叉式视频 LLM,以实际有效实现因果事件建模框架。TRACE过程将视频帧、时间戳、显著性得分和文本视为独立任务,为每个任务采用不同的编码器和解码头。任务标记按因果事件建模框架的公式进行交错排列。广泛的实验表明,TRACE 在各种 VTG 任务和数据集上均优于当前最先进的视频 LLM。我们的模型和代码已发布于 https://github.com/gyxxyg/TRACE。
引用
@article{arxiv.2410.05643,
title = {TRACE: Temporal Grounding Video LLM via Causal Event Modeling},
author = {Yongxin Guo and Jingyu Liu and Mingda Li and Qingbin Liu and Xi Chen and Xiaoying Tang},
journal= {arXiv preprint arXiv:2410.05643},
year = {2025}
}
备注
ICLR 2025