中文

对比多视角文本-视觉编码:面向十万规模一次性徽标识别

计算机视觉与模式识别 2022-11-24 v1 人工智能 机器学习

摘要

本文研究在自然场景中以开放集一次性设定识别商业品牌徽标的问题。该问题设定比传统研究的“闭集”和“每类大规模训练样本”徽标识别设定更具挑战性。我们提出一种新颖的多视角文本-视觉编码框架,将徽标中出现的文本及徽标图形设计进行编码,以学习鲁棒的对比表示。这些表示在批次内针对徽标的多视角联合学习,从而能很好地泛化至未见过的徽标。我们在裁剪徽标验证、裁剪徽标识别以及自然场景端到端徽标识别任务上评估所提框架,并与最先进方法比较。此外,文献缺乏可促进十万规模徽标识别研究的“超大规模”参考徽标图像集合。为填补此文献空白,我们引入 Wikidata 参考徽标数据集(WiRLD),包含从 Wikidata 采集的 10 万个商业品牌徽标。我们所提框架在 QMUL-OpenLogo 数据集验证任务上取得 91.3% 的 ROC 曲线下面积,在 Toplogos-10 和 FlickrLogos32 数据集的一次性徽标识别任务上分别超越最先进方法 9.1% 和 2.6%。进一步,我们表明即便候选徽标数量达 10 万规模,我们的方法也比其他基线更稳定。

关键词

引用

@article{arxiv.2211.12926,
  title  = {Contrastive Multi-View Textual-Visual Encoding: Towards One Hundred Thousand-Scale One-Shot Logo Identification},
  author = {Nakul Sharma and Abhirama S. Penamakuri and Anand Mishra},
  journal= {arXiv preprint arXiv:2211.12926},
  year   = {2022}
}

备注

Accepted to ICVGIP 2022