中文

Elysium:通过多模态大语言模型探索视频中的物体级感知

计算机视觉与模式识别 2024-04-01 v2

摘要

多模态大语言模型(Multi-modal Large Language Models, MLLMs)已展现出其在静态图像中感知物体的能力,但它们在视频相关任务(如物体跟踪)中的应用仍未得到充分研究。这种探索的缺乏主要源于两个关键挑战。首先,需要在大规模视频数据集上进行广泛预训练,才能使 MLLM 具备跨多帧感知物体并理解帧间关系的能力。其次,在大语言模型(Large Language Models, LLMs)的上下文窗口中处理大量帧会带来显著的计算负担。为解决第一个挑战,我们引入了 ElysiumTrack-1M,这是一个支持三项任务的大规模视频数据集:单目标跟踪(Single Object Tracking, SOT)、指代单目标跟踪(Referring Single Object Tracking, RSOT)和视频指代表达生成(Video Referring Expression Generation, Video-REG)。ElysiumTrack-1M 包含 127 万帧带标注的视频帧,配有相应的物体边界框和描述。利用该数据集,我们对 MLLM 进行训练,并提出了一种令牌压缩模型 T-Selector 以应对第二个挑战。我们提出的方法 Elysium:通过 MLLM 探索视频中的物体级感知,是一种端到端可训练的 MLLM,旨在无需任何额外插件或专家模型即可执行视频中的物体级任务。所有代码和数据集均可在 https://github.com/Hon-Wong/Elysium 获取。

关键词

引用

@article{arxiv.2403.16558,
  title  = {Elysium: Exploring Object-level Perception in Videos via MLLM},
  author = {Han Wang and Yanjie Wang and Yongjie Ye and Yuxiang Nie and Can Huang},
  journal= {arXiv preprint arXiv:2403.16558},
  year   = {2024}
}