通过轻量级掩码解码器发掘 MLLMs 在指代表达分割中的潜力
计算机视觉与模式识别
2025-08-20 v3 人工智能
摘要
指代表达分割(RES)旨在分割由指代表达指定的图像区域,随着多模态大模型(MLLM)的兴起而变得流行。虽然 MLLMs 在语义理解方面表现出色,但其 token 生成范式在像素级稠密预测方面存在困难。现有的 RES 方法要么将 MLLM 与拥有 632M 网络参数的 Segment Anything Model(SAM)耦合,要么采用无 SAM 的轻量级管道而牺牲精度。为解决性能与成本之间的权衡,本文特别提出 MLLMSeg,一个 novel 框架,充分利用 MLLM 视觉编码器中编码的内在视觉细节特征,而无需引入额外的视觉编码器。此外,我们提出了 detail-enhanced and semantic-consistent feature fusion module(DSFF),充分整合 MLLM 视觉编码器中的细节相关视觉特征与大语言模型(LLM)输出的语义相关特征。最后,我们建立了一个仅需 34M 网络参数的轻量级掩码解码器, optimally 利用来自视觉编码器的详细空间特征和来自 LLM 的语义特征,以实现精确的掩码预测。广泛的实验表明,我们的方法通常优于基于 SAM 和无 SAM 的竞争方法,在性能和成本之间取得更好的平衡。代码已公开于 https://github.com/jcwang0602/MLLMSeg。
引用
@article{arxiv.2508.04107,
title = {Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder},
author = {Jingchao Wang and Zhijian Wu and Dingjiang Huang and Yefeng Zheng and Hong Wang},
journal= {arXiv preprint arXiv:2508.04107},
year = {2025}
}
备注
9 pages, 4 figures