中文

IIIT-AR-13K:一种用于文档中图形对象检测的新数据集

计算机视觉与模式识别 2020-08-07 v1

摘要

我们介绍了一种用于商业文档(更具体地说是年度报告)中图形对象检测的新数据集。该数据集IIIT-AR-13K通过手动标注公开可用年度报告中的图形或页面对象的边界框创建。该数据集包含总计13k张标注页面图像,对象分为五种不同的流行类别——表格、图、自然图像、徽标和签名。它是最大的用于图形对象检测的手动标注数据集。多年间由不同公司用多种语言创建的年度报告为该数据集带来了高度多样性。我们使用Faster R-CNN[20]和Mask R-CNN[11]两种最先进的图形对象检测技术对IIIT-AR-13K数据集进行基准测试,并为进一步研究确立了高基线。我们的数据集作为训练数据对于开发商业文档和技术文章中图形对象检测的实际解决方案非常有效。通过使用IIIT-AR-13K进行训练,我们证明了单一解决方案的可行性,该方案在表格检测上报告的性能优于使用更大量数据训练的等效方案。我们希望我们的数据集有助于推进商业文档中各类图形对象检测的研究。

关键词

引用

@article{arxiv.2008.02569,
  title  = {IIIT-AR-13K: A New Dataset for Graphical Object Detection in Documents},
  author = {Ajoy Mondal and Peter Lipps and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2008.02569},
  year   = {2020}
}

备注

15 pages, DAS 2020