全景指涉图像分割
计算机视觉与模式识别
2025-12-09 v1
摘要
本文提出了一种新颖任务——全景指涉图像分割(OmniRIS),以实现高度通用的图像分割。与现有单模态条件下的分割任务(如 RIS 和视觉 RIS)不同,OmniRIS 支持文本指令和带掩码、框或草图的参考图像作为全景提示。这种特性使其能够充分利用文本和视觉两种模态的内在优势,即细粒度属性指涉和不常见物体定位。此外,OmniRIS 还能处理各种分割设置,如一对多和多对多,进一步促进其实际应用。为推动 OmniRIS 的研究,本文严格设计并构建了一个大型数据集,称为 OmniRef,包含 186,939 个全景提示,涵盖 30,956 张图像,并建立了全面的评估体系。我们还提出了一个强大且通用的基线模型 OmniSegNet,以解决 OmniRIS 的关键挑战,如全景提示编码。广泛的实验不仅验证了 OmniSegNet 在遵循全景模态指令方面的能力,还表明 OmniRIS 在高度通用图像分割方面的优势。
引用
@article{arxiv.2512.06862,
title = {Omni-Referring Image Segmentation},
author = {Qiancheng Zheng and Yunhang Shen and Gen Luo and Baiyang Song and Xing Sun and Xiaoshuai Sun and Yiyi Zhou and Rongrong Ji},
journal= {arXiv preprint arXiv:2512.06862},
year = {2025}
}