在卷积神经网络中集成文本图以检测不同文本类别的区域
计算机视觉与模式识别
2019-05-28 v1
摘要
在这项工作中,我们提出了一种在卷积神经网络(CNN)中结合外观与文本的新技术,旨在检测不同文本类别的区域。我们定义了文本语义的一种新颖视觉表示,其允许在标准 CNN 架构中无缝集成。该表示被称为文本图(text-map),与真实图像集成以为网络提供更丰富的输入。文本图根据图像上识别出的单词的相关性以不同强度着色。具体地,这些单词先前使用光学字符识别(OCR)提取,并根据属于感兴趣文本类别的概率着色。从这个意义上说,该解决方案在超市商品的条目编码背景下尤其相关,其中必须识别不同类型的文本类别,如成分或营养事实。我们在 Nielsen Brandbank 的专有条目编码数据集上评估了我们的解决方案,该数据集包含超过 10,000 张训练图像和 2,000 张测试图像。报告的结果表明,我们专注于视觉和文本数据的方法优于仅基于外观的最先进算法,如标准 Faster R-CNN。这些改进体现在精确率和召回率上,分别提高了 42 和 33 个百分点。
引用
@article{arxiv.1905.10858,
title = {Integration of Text-maps in Convolutional Neural Networks for Region Detection among Different Textual Categories},
author = {Roberto Arroyo and Javier Tovar and Francisco J. Delgado and Emilio J. Almazán and Diego G. Serrador and Antonio Hurtado},
journal= {arXiv preprint arXiv:1905.10858},
year = {2019}
}
备注
Conference on Computer Vision and Pattern Recognition (CVPR). Language and Vision Workshop 2019