惰性视觉 grounding 以开放词汇语义分割
计算机视觉与模式识别
2024-08-12 v1
摘要
我们提出惰性视觉 grounding,一种无监督对象掩码发现后再进行对象 grounding 的两阶段方法,用于开放词汇语义分割。大量前人工作将此任务视为像素到文本分类,而不进行对象层面的理解,依赖预训练视觉-语言模型的图像到文本分类能力。我们认为视觉对象无需先验文本信息即可被区分,因为分割本质上是视觉任务。惰性视觉 grounding 首先通过迭代归一化切割发现覆盖图像的对象掩码,随后以晚期交互方式对所发现的对象进行文本赋值。该模型无需额外训练,即可在五个公开数据集上取得优异性能:Pascal VOC、Pascal Context、COCO-object、COCO-stuff 和 ADE 20K。尤其,视觉上引人注目的分割结果表明了模型精确定位对象的能力。论文主页:https://cvlab.postech.ac.kr/research/lazygrounding
关键词
引用
@article{arxiv.2408.04961,
title = {In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation},
author = {Dahyun Kang and Minsu Cho},
journal= {arXiv preprint arXiv:2408.04961},
year = {2024}
}
备注
Accepted to ECCV 2024