HWNet v2:一种面向手写文档的高效词图像表示
计算机视觉与模式识别
2019-03-20 v2
摘要
我们提出了一个学习手写词图像高效整体表示的框架。所提方法使用带有传统分类损失的深度卷积神经网络。我们工作的主要优势在于:(i) 高效利用合成数据预训练深度网络,(ii) 一个适配的 ResNet-34 架构版本并结合感兴趣区域池化(称为 HWNet v2),其为可变尺寸词图像学习判别性特征,以及 (iii) 以多尺度和失真对训练数据进行逼真增强,模拟自然手写过程。我们进一步研究迁移学习以缩小合成域与真实域之间的领域鸿沟,并利用文献中提出的可视化技术分析网络不同层所学到的不变性。我们的表示在标准手写数据集和不同语言的历史手稿上以最小表示尺寸取得了最先进的词 spotting 性能。在具有挑战性的 IAM 数据集上,我们的方法首次以仅 32 维的表示尺寸报告了约 0.90 的词 spotting mAP。此外,我们还给出了在英语和印度系文字的印刷文档数据集上的结果,验证了所提框架在学习词图像表示方面的通用性。
引用
@article{arxiv.1802.06194,
title = {HWNet v2: An Efficient Word Image Representation for Handwritten Documents},
author = {Praveen Krishnan and C. V. Jawahar},
journal= {arXiv preprint arXiv:1802.06194},
year = {2019}
}
备注
20 pages, 14 figures