使用少样本目标检测的多领域文档布局理解
计算机视觉与模式识别
2018-08-23 v1
摘要
我们尝试通过一种简单算法解决文档布局理解问题,该算法在仅每领域训练少量样本的情况下可跨多个领域泛化。我们通过有监督目标检测方法处理此问题,并提出一种克服大数据集需求的方法论。我们利用迁移学习的概念,在简单人工(源)数据集上预训练目标检测器,并在微小的领域特定(目标)数据集上微调。我们表明该方法论适用于多个领域,训练样本少至10份文档。我们在最终结果中展示了该方法论各组件的作用,并显示了该方法论相对于简单目标检测器的优越性。
引用
@article{arxiv.1808.07330,
title = {Multidomain Document Layout Understanding using Few Shot Object Detection},
author = {Pranaydeep Singh and Srikrishna Varadarajan and Ankit Narayan Singh and Muktabh Mayank Srivastava},
journal= {arXiv preprint arXiv:1808.07330},
year = {2018}
}