RESAnything:面向任意指称分割的属性提示
计算机视觉与模式识别
2025-05-07 v1
摘要
我们提出了一种开放词汇且零样本的任意指称表达分割(RES)方法,其目标输入表达比先前工作设计的处理范围更广泛。具体而言,我们的输入既包含对象和部件级别的标签,也包含指向对象/部件功能、设计、风格、材料等属性或性质的隐式指称。我们的模型名为 RESAnything,利用思维链(CoT)推理,其核心思想是属性提示。我们通过系统性地提示一个大语言模型(LLM),为潜在的片段提议生成对象/部件属性的详细描述,包括形状、颜色和位置,其中提议由一个基础图像分割模型产生。我们的方法鼓励对与功能、风格、设计等相关的对象或部件属性进行深度推理,使系统能够处理隐式查询,而无需任何部件标注进行训练或微调。作为首个零样本且基于 LLM 的 RES 方法,RESAnything 在传统 RES 基准上的零样本方法中取得了明显优越的性能,并在涉及隐式查询和复杂部件级关系的挑战性场景中显著优于现有方法。最后,我们贡献了一个新的基准数据集,提供约 3K 个精心策划的 RES 实例,以评估部件级别的任意 RES 解决方案。
引用
@article{arxiv.2505.02867,
title = {RESAnything: Attribute Prompting for Arbitrary Referring Segmentation},
author = {Ruiqi Wang and Hao Zhang},
journal= {arXiv preprint arXiv:2505.02867},
year = {2025}
}
备注
42 pages, 31 figures. For more details: https://suikei-wang.github.io/RESAnything/