用于场景文本准确检测与识别的似真图像合成
计算机视觉与模式识别
2018-09-27 v2 人工智能
摘要
在训练用于各类视觉检测与识别任务的深度神经网络模型时,对大量标注图像的需求已成为一大挑战。本文提出一种新颖的图像合成技术,旨在生成大量标注场景文本图像,以训练准确且鲁棒的场景文本检测与识别模型。所提技术包含三项创新设计。首先,其通过将文本嵌入背景图像中语义合理的区域,实现“语义连贯”合成,其中语义连贯性通过利用先前语义分割研究中已创建的对象与图像区域的语义标注来达成。其次,其利用视觉显著性来确定每个语义合理区域内的嵌入位置,这与场景中文本常置于均匀区域附近以获得更好可见性的事实相符。第三,其设计了一种自适应文本外观模型,通过从真实场景文本图像特征中自适应学习来决定嵌入文本的颜色与亮度。所提技术已在五个公开数据集上评估,实验显示其在训练准确且鲁棒的场景文本检测与识别模型方面的优越性能。
引用
@article{arxiv.1807.03021,
title = {Verisimilar Image Synthesis for Accurate Detection and Recognition of Texts in Scenes},
author = {Fangneng Zhan and Shijian Lu and Chuhui Xue},
journal= {arXiv preprint arXiv:1807.03021},
year = {2018}
}
备注
14 pages, ECCV2018, datasets: https://github.com/fnzhan/Verisimilar-Image-Synthesis-for-Accurate-Detection-and-Recognition-of-Texts-in-Scenes