一统分割:视频中的语言指令推理分割
计算机视觉与模式识别
2024-10-01 v1 人工智能
摘要
我们引入了 VideoLISA,一个基于视频的多模态大语言模型,旨在解决视频中的语言指令推理分割问题。VideoLISA 利用大语言模型的推理能力和世界知识,并通过 Segment Anything Model 进行增强,能够根据语言指令在视频中生成时间上一致的分割掩码。现有的基于图像的方法(如 LISA)在处理视频任务时面临困难,因为额外的时序维度需要时序动态理解以及跨帧的一致分割。VideoLISA 通过在视频 LLM 中集成稀疏密集采样策略来应对这些挑战,该策略在计算约束内平衡了时序上下文和空间细节。此外,我们提出了一种使用专门设计的 <TRK> 令牌的“一令统分”(One-Token-Seg-All)方法,使模型能够跨多帧分割和跟踪对象。在包括我们新引入的 ReasonVOS 基准在内的多种基准上的广泛评估表明,VideoLISA 在涉及复杂推理、时序理解和对象跟踪的视频对象分割任务中表现出卓越性能。虽然针对视频进行了优化,VideoLISA 在图像分割上也显示出有前景的泛化能力,揭示了其作为语言指令对象分割统一基础模型的潜力。代码和模型将发布于:https://github.com/showlab/VideoLISA。
引用
@article{arxiv.2409.19603,
title = {One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos},
author = {Zechen Bai and Tong He and Haiyang Mei and Pichao Wang and Ziteng Gao and Joya Chen and Lei Liu and Zheng Zhang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2409.19603},
year = {2024}
}
备注
Accepted by NeurlPS 2024