用于词图像表示的监督式中层特征
计算机视觉与模式识别
2014-11-17 v2
摘要
本文探讨了词图像表示的学习问题:给定一个裁剪后的词图像,我们旨在寻找一种具有描述性、鲁棒性且紧凑的定长表示。机器学习技术可利用这些表示构建模型,以用于词检索或识别任务。尽管许多工作在生成全局表示后专注于机器学习方面,但针对这些基础图像表示构建的研究却很少:大多数工作直接在 SIFT 或 HOG 等标准计算机视觉特征之上使用标准编码和聚合技术。我们提出学习适合构建词图像表示的局部中层特征。这些特征是通过利用少量训练图像上的字符边界框标注来学习的。然而,与其他利用字符边界框信息的方法不同,我们的方法在测试时并不依赖于显式检测单个字符。随后,这些局部中层特征可被聚合以生成全局词图像签名。当将这些特征与 Almaz\'an 等人近期提出的词属性框架相结合时,我们在匹配和识别任务上获得了与最先进水平相当或更优的结果,而所使用的全局描述符维度仅为 96 维。
引用
@article{arxiv.1410.5224,
title = {Supervised mid-level features for word image representation},
author = {Albert Gordo},
journal= {arXiv preprint arXiv:1410.5224},
year = {2014}
}