Moondream 分割:从词语到掩码
计算机视觉与模式识别
2026-04-06 v1 人工智能
摘要
我们提出了 Moondream Segmentation,即 Moondream 3 这一视觉语言模型的引用图像分割扩展。给定一张图像和一个引用表达式,模型自回归地解码一条向量路径,并迭代地细化光栅化掩码以生成最终精细的掩码。我们引入了一个强化学习阶段,通过直接优化掩码质量来解决监督信号中的歧义。该阶段的 rollout 产生从粗到 ground-truth 的目标,用于细化器。为缓解多边形标注带来的评估噪声,我们发布了 RefCOCO-M,即一个经过清洗的 RefCOCO 验证集分割,包含边界精确的掩码。Moondream Segmentation 在 RefCOCO(val)上取得了 80.2% 的 cIoU,在 LVIS(val)上取得了 62.6% 的 mIoU。
引用
@article{arxiv.2604.02593,
title = {Moondream Segmentation: From Words to Masks},
author = {Ethan Reid},
journal= {arXiv preprint arXiv:2604.02593},
year = {2026}
}
备注
Demo: https://moondream.ai/me/playground