中文

一统分割:视频中的语言指令推理分割

计算机视觉与模式识别 2024-10-01 v1 人工智能

摘要

我们引入了 VideoLISA,一个基于视频的多模态大语言模型,旨在解决视频中的语言指令推理分割问题。VideoLISA 利用大语言模型的推理能力和世界知识,并通过 Segment Anything Model 进行增强,能够根据语言指令在视频中生成时间上一致的分割掩码。现有的基于图像的方法(如 LISA)在处理视频任务时面临困难,因为额外的时序维度需要时序动态理解以及跨帧的一致分割。VideoLISA 通过在视频 LLM 中集成稀疏密集采样策略来应对这些挑战,该策略在计算约束内平衡了时序上下文和空间细节。此外,我们提出了一种使用专门设计的 <TRK> 令牌的“一令统分”(One-Token-Seg-All)方法,使模型能够跨多帧分割和跟踪对象。在包括我们新引入的 ReasonVOS 基准在内的多种基准上的广泛评估表明,VideoLISA 在涉及复杂推理、时序理解和对象跟踪的视频对象分割任务中表现出卓越性能。虽然针对视频进行了优化,VideoLISA 在图像分割上也显示出有前景的泛化能力,揭示了其作为语言指令对象分割统一基础模型的潜力。代码和模型将发布于:https://github.com/showlab/VideoLISA。

关键词

引用

@article{arxiv.2409.19603,
  title  = {One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos},
  author = {Zechen Bai and Tong He and Haiyang Mei and Pichao Wang and Ziteng Gao and Joya Chen and Lei Liu and Zheng Zhang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2409.19603},
  year   = {2024}
}

备注

Accepted by NeurlPS 2024