使用 Manga109 标注的漫画目标检测
计算机视觉与模式识别
2018-03-28 v2 多媒体
摘要
随着数字化漫画的增长,图像理解技术正变得日益重要。在本文中,我们聚焦于目标检测,这是图像理解的一项基础任务。尽管基于卷积神经网络(CNN)的方法在自然图像的目标检测中取得了良好的性能,但将这些方法应用于漫画目标检测任务存在两个问题。首先,缺乏大规模标注的漫画数据集。基于 CNN 的方法需要大规模标注进行训练。其次,与自然图像相比,漫画中的目标高度重叠。这种重叠在现有的基于 CNN 的方法中会导致分配问题。为了解决这些问题,我们提出了一个新的标注数据集和一个新的 CNN 模型。我们对现有的漫画图像数据集进行了标注,创建了名为 Manga109-annotations 的最大标注数据集。针对分配问题,我们提出了一种新的基于 CNN 的检测器 SSD300-fork。我们使用 Manga109-annotations 将 SSD300-fork 与其他检测方法进行了比较,并证实基于 mAP 分数我们的模型优于它们。
引用
@article{arxiv.1803.08670,
title = {Object Detection for Comics using Manga109 Annotations},
author = {Toru Ogawa and Atsushi Otsubo and Rei Narita and Yusuke Matsui and Toshihiko Yamasaki and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:1803.08670},
year = {2018}
}
备注
http://www.manga109.org/en/