利用图像级标签扩展开放词汇图像分割
计算机视觉与模式识别
2022-07-22 v2
摘要
我们设计了一个开放词汇图像分割模型,将图像组织为由任意文本所指明的有意义区域。近期的工作(CLIP与ALIGN)尽管利用图像级描述标签获得了令人印象深刻的开放词汇分类精度,却无法以像素分割视觉概念。我们认为这些模型缺失了视觉分组这一重要步骤,即在学视觉-语义对齐之前先将像素组织成组。我们提出OpenSeg以解决上述问题,同时仍利用可扩展的描述图像级监督。首先,它学习为可能的组织方式提出分割掩码。然后,它通过将描述中的每个词与一个或多个预测掩码对齐来学习视觉-语义对齐。我们发现掩码表示是支持从描述中学习图像分割的关键,使得扩大数据集与词汇规模成为可能。得益于其可扩展性,OpenSeg在PASCAL数据集上以+19.9 mIoU显著优于近期的开放词汇方法LSeg。
引用
@article{arxiv.2112.12143,
title = {Scaling Open-Vocabulary Image Segmentation with Image-Level Labels},
author = {Golnaz Ghiasi and Xiuye Gu and Yin Cui and Tsung-Yi Lin},
journal= {arXiv preprint arXiv:2112.12143},
year = {2022}
}
备注
Accepted at ECCV 2022