基于单一分段标记的 MLLM 自身分段思考
计算机视觉与模式识别
2026-03-20 v1
摘要
近期利用多模态大语言模型 (MLLM) 的分段方法表现可靠,增强了空间感知。然而,几乎所有先前方法依赖专用 mask 解码器解释生成的分段相关嵌入和视觉特征,或纳入多个额外标记辅助。本文旨在探讨是否及如何仅通过 1 个分段嵌入 (SELF1E) 从 MLLM 本身解锁分段功能,同时实现具竞争性能的效果,无需外部解码器。为此,我们针对 MLLM 像素抽乱图像特征的分辨率降低根本限制进行改造。首先,保留图像特征的原始未压缩分辨率,并从 MLLM 处理的压缩特征中提取残差特征以填充,提高特征精度。随后,对处理前后图像特征分别整合像素抽乱操作,以释放压缩特征的细节并放大残差特征于未压缩分辨率下,进一步提升填充特征的分辨率。此外,我们重新设计注意力掩码,引入双感知路径,即图像到图像与图像到分段,实现像素与分段标记之间的丰富特征交互。跨多个分段任务的全面实验验证,SELF1E 在性能上与专用 mask 解码器方法相竞争,证明了 MLLM 无解码器分段的可行性。项目页面: https://github.com/ANDYZAQ/SELF1E。
引用
@article{arxiv.2603.19026,
title = {Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token},
author = {Anqi Zhang and Xiaokang Ji and Guangyu Gao and Jianbo Jiao and Chi Harold Liu and Yunchao Wei},
journal= {arXiv preprint arXiv:2603.19026},
year = {2026}
}
备注
Paper is accepted by CVPR 2026