中文

SAMTok:用两个词表示任意掩码

计算机视觉与模式识别 2026-01-23 v1

摘要

像素级能力对于构建交互式智能系统至关重要。然而,由于复杂的区域级编码器、专用的分割解码器以及不兼容的训练目标,像素级多模态大语言模型(MLLMs)仍然难以扩展。为了解决这些挑战,我们提出了SAMTok,一种离散掩码分词器,它将任意区域掩码转换为两个特殊标记,并使用这些标记以高保真度重建掩码。通过将掩码视为新的语言标记,SAMTok使基础MLLMs(如QwenVL系列)能够通过标准的下一标记预测和简单的强化学习来学习像素级能力,无需修改架构和设计专门的损失函数。SAMTok基于SAM2构建,并使用掩码编码器和残差向量量化器在2.09亿个多样化的掩码上进行训练,以产生离散、紧凑且信息丰富的标记。利用500万个SAMTok格式的掩码理解和生成数据样本,QwenVL-SAMTok在区域描述、区域视觉问答、有根据的对话、指代分割、场景图解析和多轮交互式分割任务上达到了最先进或可比的结果。我们进一步引入了一种文本答案匹配奖励,能够实现高效的掩码生成强化学习,在GRES和GCG基准测试上带来了显著的改进。我们的结果展示了一种可扩展且直接的范式,为MLLMs配备强大的像素级能力。我们的代码和模型已公开。

关键词

引用

@article{arxiv.2601.16093,
  title  = {SAMTok: Representing Any Mask with Two Words},
  author = {Yikang Zhou and Tao Zhang and Dengxian Gong and Yuanzheng Wu and Ye Tian and Haochen Wang and Haobo Yuan and Jiacong Wang and Lu Qi and Hao Fei and Anran Wang and Zhuochen Wang and Yujing Wang and Cheng Chen and Shunping Ji and Xiangtai Li},
  journal= {arXiv preprint arXiv:2601.16093},
  year   = {2026}
}

备注

27 pages, 11 figures