基于区域嵌入的科学文档图像细粒度目标检测
计算机视觉与模式识别
2019-10-31 v2 机器学习
图像与视频处理
机器学习
摘要
我们研究了科学文档扫描图像上的目标检测问题。我们考虑包含不同长宽比与尺寸对象的图像,其范围从表格和图形等粗粒度元素到公式和章节标题等细粒度元素。我们发现当前的目标检测器在此类页面对象上无法产生正确定位的区域提议。我们重新审视原始的 R-CNN 模型,提出了一种在文档元素上生成细粒度提议的方法。我们还提出了一种区域嵌入模型,该模型利用提议邻域的卷积特征图作为上下文,为每个提议生成嵌入。该区域嵌入能够捕捉目标区域与其周围上下文之间的语义关系。我们的端到端模型为每个提议生成嵌入,随后通过使用多头注意力模型对每个提议进行分类,该模型关注提议最重要的邻域。为评估我们的模型,我们收集并标注了一个来自异构期刊的出版物数据集。我们表明,我们称为 Attentive-RCNN 的模型相比标准目标检测模型取得了 17% 的 mAP 提升。
引用
@article{arxiv.1910.12462,
title = {Fine-Grained Object Detection over Scientific Document Images with Region Embeddings},
author = {Ankur Goswami and Joshua McGrath and Shanan Peters and Theodoros Rekatsinas},
journal= {arXiv preprint arXiv:1910.12462},
year = {2019}
}