GLUS:将全局-局部推理统一于单一大型语言模型的视频分割
计算机视觉与模式识别
2025-04-11 v1
摘要
本文提出了一种利用多模态大型语言模型(MLLM)进行指代视频目标分割(RefVOS)的新框架。以往基于 MLLM 的方法通常面临“Ref”与“VOS”之间的两难:它们要么专注于理解少数关键帧(全局推理),要么专注于在连续帧上跟踪目标(局部推理),并依赖外部 VOS 或帧选择器来缓解另一端的挑战。然而,我们的框架 GLUS 表明,全局和局部一致性可以统一到一个单一的视频分割 MLLM 中:一组稀疏的“上下文帧”提供全局信息,而一连串连续的“查询帧”进行局部目标跟踪。这进一步通过将 MLLM 与预训练的 VOS 记忆库联合训练来提供支持,以同时消化短程和长程时间信息。为了提高 MLLM 有限上下文窗口内的信息效率,我们引入了目标对比学习来区分困难的假阳性目标,并引入了自精炼框架来识别关键帧并进行传播。通过综合这些见解,我们的 GLUS 提供了一个简单而有效的基线,在 MeViS 和 Ref-Youtube-VOS 基准上取得了 MLLM 的最新技术水平。我们的项目页面位于 https://glus-video.github.io/。
引用
@article{arxiv.2504.07962,
title = {GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation},
author = {Lang Lin and Xueyang Yu and Ziqi Pang and Yu-Xiong Wang},
journal= {arXiv preprint arXiv:2504.07962},
year = {2025}
}
备注
CVPR 2025