Qwen3-VL-Seg:用于开放式指涉分段的视觉语言 grounding 方案
计算机视觉与模式识别
2026-05-11 v1 人工智能
摘要
开放式指涉分段需要将无约束的语言表达式锚定到精确的像素级区域。现有多模态大语言模型(MLLM)在开放式视觉 grounding 方面表现出强大的能力,但其输出仅限于稀疏的边界框坐标,对于密集视觉预测不够。最近基于 MLLM 的分段方法要么直接预测稀疏轮廓坐标,难以重建连续物体边界;要么依赖外部分段基础模型如 Segment Anything Model(SAM),引入显著的架构和部署开销。我们提出 Qwen3-VL-Seg,一个参数高效框架,将 MLLM 预测的框视为语义锚定的结构先验,并解码为像素级指涉分段。在其核心,轻量级框导向掩码解码器结合了多尺度空域特征注入、空域-语义查询构建、框导向高分辨率像素融合以及迭代掩码感知查询细化,仅引入 17M 参数(约占基础模型的 0.4%)。为实现可扩展的开放式训练,我们构建了 SA1B-ORS 数据集,源自 SA-1B 数据集,包含两个子集:SA1B-CoRS(面向类别的样本)和 SA1B-DeRS(描述性、实例特定的样本)。为进行评估,我们精选了 ORS-Bench,一个包含分布内和分布外子集,涵盖多种指涉表达式类型的手动筛选基准。大量实验在指涉表达式分段、视觉 grounding 以及 ORS-Bench 上表明,Qwen3-VL-Seg 在封闭集和开放式设置下均表现强劲,尤其在语言密集型指令和强分布外推广方面具有显著优势。在通用多模态基准上的评估进一步显示,该模型在分段导向适应后仍保持较广泛的通用多模态能力。
引用
@article{arxiv.2605.07141,
title = {Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding},
author = {Yuan Yao and Qiushi Yang and Humen Zhong and Jiangning Wei and Yifang Men and Shuai Bai and Miaomiao Cui and Zhibo Yang},
journal= {arXiv preprint arXiv:2605.07141},
year = {2026}
}