中文

面向科学绘图的目标检测网络系统性评估

计算机视觉与模式识别 2020-12-22 v2

摘要

现有的目标检测方法是否足以检测科学绘图中的文本与视觉元素?这些元素可以说不同于自然图像中的物体。为回答此问题,我们在 PlotQA 数据集上训练并比较了多种 SOTA 目标检测网络的精度。在 0.5 的标准 IOU 设定下,大多数网络表现良好,对绘图中相对简单物体的检测 mAP 得分大于 80%。然而,在更严格的 0.9 IOU 下评估时性能急剧下降,最佳模型 mAP 仅为 35.70%。需注意,在处理科学绘图时此类更严格的评估至关重要,因为即便微小的定位误差也会导致下游数值推断中的大错误。鉴于此不佳表现,我们通过结合不同目标检测网络的思路对现有模型提出细微修改。虽显著提升了性能,仍存在两个主要问题:(i)对推理至关重要的文本对象性能很差,(ii)考虑到绘图的简单性,推理时间大得不可接受。为解决这一开放问题,我们做出一系列贡献:(a)基于拉普拉斯边缘检测器的高效区域提议方法,(b)包含邻域信息的区域提议特征表示,(c)连接多个区域提议以检测较长文本对象的链接组件,以及(d)结合平滑 L1 损失与基于 IOU 损失的自定义损失函数。结合这些思路,我们的最终模型在极端 IOU 值下非常准确,达到 93.44%@0.9 IOU 的 mAP。同时,我们的模型非常高效,推理时间比现有模型(包括单阶段检测器)少 16 倍。借助这些贡献,我们推动了绘图自动推理的进一步探索。

关键词

引用

@article{arxiv.2007.02240,
  title  = {A Systematic Evaluation of Object Detection Networks for Scientific Plots},
  author = {Pritha Ganguly and Nitesh Methani and Mitesh M. Khapra and Pratyush Kumar},
  journal= {arXiv preprint arXiv:2007.02240},
  year   = {2020}
}

备注

This work has been accepted and will be presented at AAAI 2021