极度细粒度图像分类:野外场景中难以区分的字体字符
计算机视觉与模式识别
2024-08-27 v1
摘要
野外文本识别是数字地图和城市场景理解中重要的技术,自然字体之间的相似性是导致错误识别结果的主要原因之一。为此,我们引入两个包含极度挑战性难以区分字体(字符/字母)的极度细粒度视觉识别基准数据集。此外,我们提出一种简单而有效的两阶段对比学习方法,用于处理难以区分字体的识别任务。在第一阶段,我们利用监督对比学习利用标签信息对背板网络进行预热。在第二阶段,我们提出CFGNet一种网络架构,将分类和对比学习在欧几里得空间和角度空间中集成,其中对比学习以监督学习和成对鉴别两种方式应用,以增强模型的特征表示能力。总体而言,我们的方法有效地利用了对比学习和分类的互补优势,提高了难以区分字体的识别性能。与基于卷积神经网络(CNN)和Transformer背板的领先的细粒度分类方法进行比较评估,证明了我们方法的优越性。
引用
@article{arxiv.2408.13774,
title = {Extremely Fine-Grained Visual Classification over Resembling Glyphs in the Wild},
author = {Fares Bougourzi and Fadi Dornaika and Chongsheng Zhang},
journal= {arXiv preprint arXiv:2408.13774},
year = {2024}
}
备注
13 pages, 7 Figures, 8 Tables