基于多粒度文本监督的开放集图像标注
计算机视觉与模式识别
2023-11-20 v2
摘要
本文介绍了Recognize Anything Plus Model(RAM++),一种有效利用多粒度文本监督的开放集图像标注模型。先前的方法(如CLIP)主要利用与图像配对的全局文本监督,导致在识别多个独立语义标签时性能次优。相比之下,RAM++在统一的对齐框架内无缝整合了独立标签监督与全局文本监督。这种整合不仅确保了预定义标签类别的高效识别,还增强了对多样化开放集类别的泛化能力。此外,RAM++采用大语言模型(LLMs)将语义受限的标签监督转化为更丰富的标签描述监督,从而拓展了开放集视觉描述概念的范围。在多个图像识别基准上的综合评估表明,RAM++在大多数方面超越了现有的state-of-the-art(SOTA)开放集图像标注模型。具体而言,对于预定义的常用标签类别,RAM++在OpenImages和ImageNet上分别较CLIP提升了10.2 mAP和15.4 mAP。对于预定义之外的开放集类别,RAM++在OpenImages上分别较CLIP和RAM提升了5.0 mAP和6.4 mAP。对于多样化的人-物交互短语,RAM++在HICO基准上实现了7.8 mAP和4.7 mAP的提升。代码、数据集和预训练模型可在\url{https://github.com/xinyu1205/recognize-anything}获取。
引用
@article{arxiv.2310.15200,
title = {Open-Set Image Tagging with Multi-Grained Text Supervision},
author = {Xinyu Huang and Yi-Jie Huang and Youcai Zhang and Weiwei Tian and Rui Feng and Yuejie Zhang and Yanchun Xie and Yaqian Li and Lei Zhang},
journal= {arXiv preprint arXiv:2310.15200},
year = {2023}
}
备注
Homepage: https://github.com/xinyu1205/recognize-anything