重新思考具有低延迟、高质量和多样化提示的交互式图像分割
计算机视觉与模式识别
2024-04-02 v1
摘要
交互式图像分割的目标是通过视觉或语言提示勾勒出图像中的特定区域。对于现有的专用模型和通用模型而言,实现具有多样化提示的低延迟和高质量交互式分割仍然具有挑战性。专用模型由于其有限的提示和特定任务的设计,延迟较高,因为图像和视觉提示的联合编码导致每次更新提示时都必须重新计算图像。以 Segment Anything Model (SAM) 为代表的通用模型近期在提示多样性和效率方面表现出色,将图像分割推向了基础模型时代。然而,尽管 SAM 使用了多 100 倍的分割掩码进行训练,但在高质量分割方面,SAM 仍然落后于 SOTA 专用模型。在这项工作中,我们深入探讨了这两类模型之间的架构差异。我们观察到,视觉提示的密集表示和融合是促成专用模型高分割质量的关键设计选择。有鉴于此,我们将这种密集设计重新引入通用模型,以促进具有高分割质量的通用模型的发展。为了密集地表示多样的视觉提示,我们提议使用密集图来捕获五种类型:点击、框、多边形、涂鸦和掩码。因此,我们提出了 SegNext,这是一种提供低延迟、高质量和多样化提示支持的下一代交互式分割方法。我们的方法在 HQSeg-44K 和 DAVIS 上在定量和定性方面均优于当前 SOTA 方法。
引用
@article{arxiv.2404.00741,
title = {Rethinking Interactive Image Segmentation with Low Latency, High Quality, and Diverse Prompts},
author = {Qin Liu and Jaemin Cho and Mohit Bansal and Marc Niethammer},
journal= {arXiv preprint arXiv:2404.00741},
year = {2024}
}
备注
CVPR 2024 https://github.com/uncbiag/SegNext