X2SAM:图像和视频中的通用分割
计算机视觉与模式识别
2026-05-05 v1 人工智能
摘要
多模态大语言模型(MLLMs)在图像级视觉理解和推理方面表现出色,但在图像和视频的像素级感知能力仍有限。基础分割模型如 SAM 系列能够生成高质量掩码,但依赖低级视觉提示,无法原生解释复杂的对话指令。现有的分割 MLLMs 试图缩小这一差距,但通常专注于图像或视频之一,很少支持一种界面中的文本和视觉提示。我们引入 X2SAM,一种统一的分割 MLLM,将从图像扩展到视频的任意分割能力。给定对话指令和视觉提示,X2SAM 将 LLM 与掩码记忆模块耦合,后者存储引导视觉特征,用于在视频中生成具有时序一致性的掩码。该 formulations 支持图像和视频输入上的通用、开放词汇、指代、推理、 grounded 对话生成、交互式和视觉 grounding 分割。我们进一步引入视频视觉 grounding(V-VGD)分割基准,评估模型是否能从交互式视觉提示在视频中分割对象轨迹。通过对异构图像和视频数据集进行统一联合训练,X2SAM 在视频分割任务中表现出色,在图像分割基准上保持竞争力,同时保留通用的图像和视频聊天能力。
引用
@article{arxiv.2605.00891,
title = {X2SAM: Any Segmentation in Images and Videos},
author = {Hao Wang and Limeng Qiao and Chi Zhang and Lin Ma and Guanglu Wan and Xiangyuan Lan and Xiaodan Liang},
journal= {arXiv preprint arXiv:2605.00891},
year = {2026}
}
备注
Technical Report