识别万物:一种强力的图像标注模型
计算机视觉与模式识别
2023-06-12 v3
摘要
我们提出识别万物模型(RAM):一种用于图像标注的强基础模型。RAM 在计算机视觉的大模型方面迈出了实质性一步,展示了以高精度识别任意常见类别的零样本能力。RAM 引入了图像标注的新范式,利用大规模图像-文本对进行训练,而非人工标注。RAM 的开发包含四个关键步骤。首先,通过自动文本语义解析大规模获取无标注图像标签。随后,通过统一描述生成与标注任务,分别由原始文本与解析标签监督,训练一个用于自动标注的初步模型。第三,采用数据引擎生成额外标注并清理错误标注。最后,利用处理后的数据重新训练模型,并使用规模更小但质量更高的数据集进行微调。我们在众多基准上评估 RAM 的标注能力,观察到令人印象深刻的零样本性能,显著优于 CLIP 和 BLIP。值得注意的是,RAM 甚至超越全监督方式,并展现出与 Google 标注 API 相竞争的性能。我们在 \url{https://recognize-anything.github.io/} 发布 RAM,以促进计算机视觉大模型的发展。
引用
@article{arxiv.2306.03514,
title = {Recognize Anything: A Strong Image Tagging Model},
author = {Youcai Zhang and Xinyu Huang and Jinyu Ma and Zhaoyang Li and Zhaochuan Luo and Yanchun Xie and Yuzhuo Qin and Tong Luo and Yaqian Li and Shilong Liu and Yandong Guo and Lei Zhang},
journal= {arXiv preprint arXiv:2306.03514},
year = {2023}
}
备注
Homepage: https://recognize-anything.github.io/