中文

Moondream 分割:从词语到掩码

计算机视觉与模式识别 2026-04-06 v1 人工智能

摘要

我们提出了 Moondream Segmentation,即 Moondream 3 这一视觉语言模型的引用图像分割扩展。给定一张图像和一个引用表达式,模型自回归地解码一条向量路径,并迭代地细化光栅化掩码以生成最终精细的掩码。我们引入了一个强化学习阶段,通过直接优化掩码质量来解决监督信号中的歧义。该阶段的 rollout 产生从粗到 ground-truth 的目标,用于细化器。为缓解多边形标注带来的评估噪声,我们发布了 RefCOCO-M,即一个经过清洗的 RefCOCO 验证集分割,包含边界精确的掩码。Moondream Segmentation 在 RefCOCO(val)上取得了 80.2% 的 cIoU,在 LVIS(val)上取得了 62.6% 的 mIoU。

关键词

引用

@article{arxiv.2604.02593,
  title  = {Moondream Segmentation: From Words to Masks},
  author = {Ethan Reid},
  journal= {arXiv preprint arXiv:2604.02593},
  year   = {2026}
}

备注

Demo: https://moondream.ai/me/playground