V3Det:大词汇量视觉检测数据集
计算机视觉与模式识别
2023-10-06 v2
摘要
近期在真实世界中检测任意物体的进展,是在词汇量相对受限的目标检测数据集上训练和评估的。为促进更通用视觉目标检测的发展,我们提出 V3Det,一个在海量图像上带有精确标注边界框的大词汇量视觉检测数据集。V3Det 具有若干引人注目的特性:1)大词汇量:它包含真实世界图像中 13,204 个类别物体的边界框,比现有大词汇量目标检测数据集(如 LVIS)大 10 倍。2)层次化类别组织:V3Det 的大词汇量由层次化类别树组织,标注了类别间的包含关系,鼓励在庞大且开放词汇量目标检测中探索类别关系。3)丰富标注:V3Det 包含 243k 图像中精确标注的物体,以及由人类专家和一个强大聊天机器人撰写的各类别专业描述。通过提供广阔的探索空间,V3Det 支持在庞大与开放词汇量目标检测上的广泛基准测试,带来新的观察、实践与对未来研究的洞见。它有潜力作为开发更通用视觉感知系统的基石数据集。V3Det 可在 https://v3det.openxlab.org.cn/ 获取。
引用
@article{arxiv.2304.03752,
title = {V3Det: Vast Vocabulary Visual Detection Dataset},
author = {Jiaqi Wang and Pan Zhang and Tao Chu and Yuhang Cao and Yujie Zhou and Tong Wu and Bin Wang and Conghui He and Dahua Lin},
journal= {arXiv preprint arXiv:2304.03752},
year = {2023}
}
备注
ICCV 2023 Oral Camera Ready