更好、更强、更快:通过同时文本掩码预测解决 MLLM 分割中的三难题
计算机视觉与模式识别
2025-12-02 v1
摘要
将分割集成到多模态大语言模型 (MLLM) 中存在核心三难题:同时保持对话能力、实现高分割性能并确保快速推理。现有主流方法被迫妥协。嵌入预测方法引入与像素级目标相关的目标,导致 MLLM 的通用对话能力受损。另一种方法是基于下一个标记预测,将分割重新框定为自回归任务,这保留了对话能力,但在稀疏输出导致分割性能差或丰富输出导致推理速度不可接受之间作出妥协。我们通过全掩码预测(all-mask prediction)解决了这一三难题,这是一种新颖的范式,将自回归对话生成与非自回归掩码预测解耦。我们提出了 STAMP:Simultaneous Textual All-Mask Prediction,一款体现该范式的 MLLM。在生成文本响应后,STAMP 以单次前向传递预测整个分割掩码,将其视为图像块上的并行“填空”任务。该设计通过避免冲突目标保持 MLLM 的对话能力,利用丰富的双向空间上下文实现高分割性能,并实现卓越的速度。大量实验表明,STAMP 在多个分割基准上显著优于最先进的方法,提供了一个在对话、分割和速度方面无需妥协的解决方案。
引用
@article{arxiv.2512.00395,
title = {Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction},
author = {Jiazhen Liu and Mingkuan Feng and Long Chen},
journal= {arXiv preprint arXiv:2512.00395},
year = {2025}
}