中文

利用场景文本进行知识挖掘以实现细粒度识别

计算机视觉与模式识别 2022-03-29 v1

摘要

近来,场景文本的语义已被证明在细粒度图像分类中至关重要。然而,现有方法主要利用场景文本的字面含义进行细粒度识别,当其与所述物体/场景无显著关联时可能无关。我们提出一种端到端可训练网络,挖掘场景文本图像背后的隐式上下文知识,并增强语义及其相关性以微调图像表示。与现有方法不同,我们的模型集成了三种模态:视觉特征提取、文本语义提取以及关联背景知识以用于细粒度图像分类。具体而言,我们采用 KnowBert 检索相关知识用于语义表示,并将其与图像特征结合以进行细粒度分类。在两个基准数据集 Con-Text 和 Drink Bottle 上的实验表明,我们的方法分别以 3.72% mAP 和 5.39% mAP 优于当前最优方法。为进一步验证所提方法的有效性,我们构建了一个用于评估的人群活动识别新数据集。本工作的源代码与新数据集可在 https://github.com/lanfeng4659/KnowledgeMiningWithSceneText 获取。

关键词

引用

@article{arxiv.2203.14215,
  title  = {Knowledge Mining with Scene Text for Fine-Grained Recognition},
  author = {Hao Wang and Junchao Liao and Tianheng Cheng and Zewen Gao and Hao Liu and Bo Ren and Xiang Bai and Wenyu Liu},
  journal= {arXiv preprint arXiv:2203.14215},
  year   = {2022}
}

备注

Accepted to CVPR 2022. The source code and new dataset of this work are available at https://github.com/lanfeng4659/KnowledgeMiningWithSceneText