通过视觉语言提示引用任意分割掩码组
计算机视觉与模式识别
2025-10-20 v2 人工智能
摘要
近期图像分割模型已进步至对视觉实体分割为高质量掩码,但无法为基于语言与视觉的复杂查询提供全面的语义理解。此限制降低了需要基于视觉语言提示的用户友好交互的应用效果。为弥合这一差距,我们提出一种新任务——全模态指代分割(Omnimodal Referring Expression Segmentation, ORES)。在该任务中,模型根据仅由文本指定或文本外加参考视觉实体指定的任意掩码组生成掩码。为解决这一新挑战,我们提出一种新框架“引用任意分割掩码组”(Refer to Any Segmentation Mask Group, RAS),该框架通过基于掩码的大型多模态模型增强分割模型的复杂多模态交互与理解能力。为训练与评估ORES模型,我们创建了包括MaskGroups-2M与MaskGroups-HQ在内的数据集,包含由文本和参考实体指定的多样化掩码组。通过广泛评估,我们展示了RAS在新ORES任务、经典指代分割(RES)与通用指代分割(GRES)任务中的优异性能。项目页面:https://Ref2Any.github.io。
引用
@article{arxiv.2506.05342,
title = {Refer to Any Segmentation Mask Group With Vision-Language Prompts},
author = {Shengcao Cao and Zijun Wei and Jason Kuen and Kangning Liu and Lingzhi Zhang and Jiuxiang Gu and HyunJoon Jung and Liang-Yan Gui and Yu-Xiong Wang},
journal= {arXiv preprint arXiv:2506.05342},
year = {2025}
}
备注
ICCV 2025