Open Images V4数据集:大规模统一图像分类、目标检测与视觉关系检测
计算机视觉与模式识别
2020-03-26 v2
摘要
我们提出Open Images V4,一个包含920万张图像的数据集,具有统一的图像分类、目标检测和视觉关系检测标注。这些图像采用知识共享署名许可,允许共享与改编,且从Flickr收集时未使用预定义的类名或标签列表,从而产生了自然的类别统计并避免了初始设计偏差。Open Images V4在多个维度上提供大规模数据:19.8k个概念的3010万图像级标签、600个对象类的1540万边界框,以及涉及57个类的37.5万视觉关系标注。尤其在目标检测方面,我们提供的边界框数量比下一个最大数据集多15倍(190万张图像上的1540万框)。图像常展现含多个对象的复杂场景(平均每张图像8个标注对象)。我们标注了它们之间的视觉关系,支持视觉关系检测这一需要结构化推理的新兴任务。我们提供了关于该数据集的深入全面统计,验证了标注质量,研究了若干现代模型性能随训练数据量增加的变化,并展示了因同一图像中多种类型统一标注共存而成为可能的两个应用。我们希望Open Images V4的规模、质量和多样性将促进超越图像分类、目标检测和视觉关系检测领域的进一步研究与创新。
引用
@article{arxiv.1811.00982,
title = {The Open Images Dataset V4: Unified image classification, object detection, and visual relationship detection at scale},
author = {Alina Kuznetsova and Hassan Rom and Neil Alldrin and Jasper Uijlings and Ivan Krasin and Jordi Pont-Tuset and Shahab Kamali and Stefan Popov and Matteo Malloci and Alexander Kolesnikov and Tom Duerig and Vittorio Ferrari},
journal= {arXiv preprint arXiv:1811.00982},
year = {2020}
}
备注
Accepted to International Journal of Computer Vision, 2020