中文

ReVisionLLM:用于小时级视频时序定位的递归视觉语言模型

计算机视觉与模式识别 2024-11-25 v1 计算与语言

摘要

大型语言模型(LLM)在从长文本中检索信息方面表现出色,但其视觉语言模型(VLM)在处理小时级视频时面临挑战,尤其是时序定位方面。具体而言,这些VLM受限于帧数,往往丢失对长时间视频内容中精准事件定位所必需的关键时序细节。我们提出ReVisionLLM,一种递归式视觉语言模型,用于定位小时级视频中的事件。灵感来源于人类的搜索策略,该模型首先针对感兴趣的广泛片段进行定位,然后逐步修正焦点,以确定确切的时序边界。该模型能无缝处理长度差异巨大的视频,从分钟级到小时级。我们还引入了分层训练策略,先训练短片段以捕获不同事件,再逐步扩展到更长的视频。据我们所知,ReVisionLLM是首个能够进行小时级视频时序定位的VLM,经过多个数据集的显著提升(在MAD上[email protected]提升+2.6%)。代码已公开于https://github.com/Tanveer81/ReVisionLLM。

关键词

引用

@article{arxiv.2411.14901,
  title  = {ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos},
  author = {Tanveer Hannan and Md Mohaiminul Islam and Jindong Gu and Thomas Seidl and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2411.14901},
  year   = {2024}
}