中文

面向 Logo 识别的图像-文本预训练

计算机视觉与模式识别 2023-09-20 v1

摘要

开放集 Logo 识别通常通过先检测可能的 Logo 区域,再将检测部分与一个不断演化的裁剪 Logo 图像数据集进行匹配来解决。匹配模型作为一个度量学习问题,因 Logo 中文本与符号的混合而对 Logo 识别尤为困难。我们提出两项新颖贡献以提升匹配模型性能:(a)使用图像-文本配对样本进行预训练;(b)一种改进的度量学习损失函数。微调 ImageNet 预训练模型的标准范式未能发掘有效解决匹配问题所需的文本敏感性。本工作展示了在图像-文本对上预训练的重要性,其显著提升了为 Logo 检索任务训练的视觉嵌入器性能,尤其对更偏文本主导的类别。我们构建了一个结合 LogoDet3K、OpenLogo 与 FlickrLogos-47 的复合公共 Logo 数据集,称为 OpenLogoDet3K47。我们表明,同一视觉骨干在图像-文本数据上预训练后,于 OpenLogoDet3K47 上微调可达到 98.6%98.6\% 的 recall@1,较在 ImageNet1K 上预训练(97.6%97.6\%)性能显著提升。我们将 ProxyNCA++ 损失函数推广提出 ProxyNCAHN++,其融入了类特定的困难负样本图像。所提方法在考虑的五个公共 Logo 数据集上均刷新了最优水平,在 LogoDet3K 测试集上零样本 recall@1 提升 3.5%3.5\%,OpenLogo 上 4%4\%,FlickrLogos-47 上 6.5%6.5\%,Logos In The Wild 上 6.2%6.2\%,BelgaLogo 上 0.6%0.6\%

关键词

引用

@article{arxiv.2309.10206,
  title  = {Image-Text Pre-Training for Logo Recognition},
  author = {Mark Hubenthal and Suren Kumar},
  journal= {arXiv preprint arXiv:2309.10206},
  year   = {2023}
}

备注

8 pages, 5 figures, 4 tables