ROSE:检索导向分段增强
摘要
基于多模态大语言模型(MLLM)的现有分段模型(如 LISA)常在 novel 或 emerging 实体方面困难,因其无法纳入最新知识。为解决这一挑战,我们提出 Novel Emerging Segmentation Task(NEST),聚焦于分段(i) MLLMs 因训练数据中不存在而无法识别的 novel 实体,和 (ii) 存在于模型知识中但需要最新外部信息才能准确识别的 emerging 实体。为支持 NEST 研究,我们构建了一个使用自动化管道生成新闻相关数据样本的 NEST benchmark 以进行全面评估。此外,我们提出 ROSE:检索导向分段增强,一个 plug-and-play 框架,用于增强任何 MLLM-based 分段模型。ROSE 包含四个关键组件。首先,引入 Internet Retrieval-Augmented Generation 模块,用用户提供的 multimodal 输入检索真实 web 信息。然后,Textual Prompt Enhancer 通过更新信息和丰富背景知识来丰富模型,提高对 emerging 实体的感知能力。进一步提出 Visual Prompt Enhancer 通过利用来自 internet 的图像来弥补 MLLMs 对 novel 实体的缺乏曝光。为保持效率,我们引入 WebSense 模块,智能决定何时调用检索机制。实验结果表明,ROSE 在 NEST benchmark 上显著提升性能,超越一个强大的 Gemini-2.0 Flash-based 检索基线 19.2 的 gIoU。
引用
@article{arxiv.2604.14147,
title = {ROSE: Retrieval-Oriented Segmentation Enhancement},
author = {Song Tang and Guangquan Jie and Henghui Ding and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2604.14147},
year = {2026}
}
备注
CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/