LogoDet-3K:用于Logo检测的大规模图像数据集
计算机视觉与模式识别
2020-08-13 v1 多媒体
摘要
Logo检测因其在多媒体领域的广泛应用(如版权侵权检测、品牌曝光监测以及社交媒体上的产品品牌管理)而受到相当关注。本文介绍LogoDet-3K,这是具有完整标注的最大Logo检测数据集,包含3,000个Logo类别、约200,000个手动标注的Logo目标以及158,652张图像。与现有数据集相比,LogoDet-3K因在Logo类别和标注目标上更高的综合覆盖与更广的多样性,为Logo检测创建了更具挑战性的基准。我们描述了数据集的收集与标注过程,并与其他Logo检测数据集比较其规模与多样性。我们进一步提出一种强基线方法Logo-Yolo,将Focal loss与CIoU loss融入最先进的YOLOv3框架以进行大规模Logo检测。Logo-Yolo可解决多尺度目标、Logo样本不平衡以及边界框回归不一致的问题。其在平均性能上相比YOLOv3提升约4%,且相比在LogoDet-3K上报告的若干深度检测模型提升更大。在其他三个现有数据集上的评估进一步验证了方法的有效性,并展示了LogoDet-3K在Logo检测与检索任务上更好的泛化能力。LogoDet-3K数据集用于促进大规模Logo相关研究,可在 https://github.com/Wangjing1551/LogoDet-3K-Dataset 获取。
引用
@article{arxiv.2008.05359,
title = {LogoDet-3K: A Large-Scale Image Dataset for Logo Detection},
author = {Jing Wang and Weiqing Min and Sujuan Hou and Shengnan Ma and Yuanjie Zheng and Shuqiang Jiang},
journal= {arXiv preprint arXiv:2008.05359},
year = {2020}
}