中文

Grounded SAM:组装开放世界模型以应对多样化视觉任务

计算机视觉与模式识别 2024-01-26 v1

摘要

我们引入了 Grounded SAM,它使用 Grounding DINO 作为开放集目标检测器,与分割一切模型 (SAM) 相结合。这种集成能够基于任意文本输入检测和分割任何区域,并为连接各种视觉模型打开了大门。如图 1 所示,通过使用多功能的 Grounded SAM 流程,可以实现广泛的视觉任务。例如,仅基于输入图像的自动标注流程可以通过整合 BLIP 和 Recognize Anything 等模型来实现。此外,结合 Stable-Diffusion 可实现可控的图像编辑,而集成 OSX 则有助于可提示的三维人体运动分析。Grounded SAM 在开放词汇基准测试中也表现出卓越性能,结合 Grounding DINO-Base 和 SAM-Huge 模型,在 SegInW(野外分割)零样本基准测试中达到了 48.7 的平均精度 (AP)。

关键词

引用

@article{arxiv.2401.14159,
  title  = {Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks},
  author = {Tianhe Ren and Shilong Liu and Ailing Zeng and Jing Lin and Kunchang Li and He Cao and Jiayu Chen and Xinyu Huang and Yukang Chen and Feng Yan and Zhaoyang Zeng and Hao Zhang and Feng Li and Jie Yang and Hongyang Li and Qing Jiang and Lei Zhang},
  journal= {arXiv preprint arXiv:2401.14159},
  year   = {2024}
}