TimeRefine:基于时间细化的视频 LLM 时间定位
计算机视觉与模式识别
2025-03-06 v2 人工智能
计算与语言
摘要
视频时间定位旨在给定文本提示,在视频中局化相关的时间边界。近期研究致力于通过预测时间戳的下一个标记,使视频 LLM 能够执行视频时间定位。然而,仅依赖时间标记预测,视频 LLM 在准确局化视频中的时间戳方面仍具有挑战。我们提出的 TimeRefine 通过两种方式来解决此挑战:第一,与直接预测开始和结束时间戳不同,我们将时间定位任务重新表述为时间细化任务:模型首先进行粗略预测,然后通过预测相对于目标片段的偏移量来进行细化。通过多次重复该细化过程,模型逐步自我改进其时间局化准确性。第二,为增强模型的时间感知能力,我们引入一个辅助预测头,如果预测片段与真实值之间的偏差更大,则对模型进行更大的惩罚,从而鼓励模型进行更接近且更准确的预测。我们的方法具有即插即用的特性,可集成到大多数基于 LLM 的时间定位方法中。实验结果表明,TimeRefine 在 ActivityNet 和 Charades-STA 数据集上分别实现了 3.6% 和 5.0% 的 mIoU 提升。代码和预训练模型将发布。
引用
@article{arxiv.2412.09601,
title = {TimeRefine: Temporal Grounding with Time Refining Video LLM},
author = {Xizi Wang and Feng Cheng and Ziyang Wang and Huiyu Wang and Md Mohaiminul Islam and Lorenzo Torresani and Mohit Bansal and Gedas Bertasius and David Crandall},
journal= {arXiv preprint arXiv:2412.09601},
year = {2025}
}