一次性分割万物、处处、全部
计算机视觉与模式识别
2023-07-13 v4
摘要
在本工作中,我们提出 SEEM,一种可提示且交互式的模型,用于如图 1 所示在一次推理中分割图像中的万物、处处、全部。在 SEEM 中,我们提出一种新颖的解码机制,支持针对所有类型分割任务的多样化提示,旨在构建如大语言模型(LLMs)般通用的分割接口。更具体地,SEEM 设计满足四项诉求:i) 通用性。我们引入一种新的视觉提示以统一包括点、框、涂鸦与掩码的不同空间查询,并可进一步泛化至不同的参考图像;ii) 组合性。我们学习文本与视觉提示之间的联合视觉-语义空间,促进各类分割任务所需的两种提示类型的动态组合;iii) 交互性。我们进一步将可学习记忆提示融入解码器,通过从解码器到图像特征的掩码引导交叉注意力来保留分割历史;iv) 语义感知。我们使用文本编码器将文本查询与掩码标签编码至同一语义空间,用于开放词汇分割。我们开展了全面的实证研究,以验证 SEEM 在多样分割任务上的有效性。值得注意的是,我们单一的 SEEM 模型在 9 个数据集上以最少 1/100 的监督取得了交互式分割、通用分割、指代分割与视频目标分割的竞争性性能。此外,SEEM 展现出对新提示或其组合的卓越泛化能力,使其成为即用的通用图像分割接口。
引用
@article{arxiv.2304.06718,
title = {Segment Everything Everywhere All at Once},
author = {Xueyan Zou and Jianwei Yang and Hao Zhang and Feng Li and Linjie Li and Jianfeng Wang and Lijuan Wang and Jianfeng Gao and Yong Jae Lee},
journal= {arXiv preprint arXiv:2304.06718},
year = {2023}
}