中文

用于场景文本检测的马尔可夫聚类网络学习

计算机视觉与模式识别 2018-05-23 v1

摘要

本文提出一种名为马尔可夫聚类网络(Markov Clustering Network, MCN)的新框架,用于快速且鲁棒的场景文本检测。MCN 首先将对图像转换为随机流图(Stochastic Flow Graph, SFG),然后在该图上执行马尔可夫聚类,从而预测实例级边界框。我们的方法无需物体尺寸的先验知识即可检测任意大小和方向的文本对象。随机流图编码物体的局部相关性与语义信息。一个物体被建模为强连通节点,从而允许对尺度变化和旋转物体进行灵活的自底向上检测。MCN 在不使用非极大值抑制(Non-Maximum Suppression)的情况下生成边界框,并且可在 GPU 上完全并行化。在公开基准上的评估表明,我们的方法在多方向文本对象检测上大幅优于现有方法。MCN 在具有挑战性的 MSRA-TD500 数据集上取得了新的 SOTA 性能,精确率为 0.88,召回率为 0.79,F 值为 0.83。此外,MCN 以 34 FPS 的帧率实现实时推理,与最快的场景文本检测算法相比实现了 1.5×1.5\times 的加速。

关键词

引用

@article{arxiv.1805.08365,
  title  = {Learning Markov Clustering Networks for Scene Text Detection},
  author = {Zichuan Liu and Guosheng Lin and Sheng Yang and Jiashi Feng and Weisi Lin and Wang Ling Goh},
  journal= {arXiv preprint arXiv:1805.08365},
  year   = {2018}
}