中文

文档图像表示的正确方式是什么?

计算机视觉与模式识别 2016-12-05 v3

摘要

本文中,我们研究了基于视觉特征的文档图像表示问题。我们提出了一项综合实验研究,比较了三种类型的视觉文档图像表示:(1) 传统的所谓浅层特征,如RunLength和Fisher-Vector描述子,(2) 基于卷积神经网络(Convolutional Neural Networks)的深度特征,以及 (3) 从受前两者启发的混合架构中提取的特征。我们使用多个公开和内部数据集,在多个任务(即分类、聚类和检索)和不同设置(例如域迁移)下评估这些特征。我们的结果表明,当不存在域偏移且新任务与用于训练模型的任务密切相关时,深度特征通常优于其他类型的特征。然而,当存在较大的域或任务偏移时,Fisher-Vector浅层特征泛化更好,并且经常获得最佳结果。

关键词

引用

@article{arxiv.1603.01076,
  title  = {What is the right way to represent document images?},
  author = {Gabriela Csurka and Diane Larlus and Albert Gordo and Jon Almazan},
  journal= {arXiv preprint arXiv:1603.01076},
  year   = {2016}
}