Transformer 与 CNN 在草图检索任务上均超越人类
计算机视觉与模式识别
2022-09-15 v1 人工智能
信息检索
摘要
基于草图的图像检索(SBIR)是检索与手绘草图查询的语义和空间构型相匹配的自然图像(照片)的任务。草图的通用性拓展了可能的应用范围并增加了对高效 SBIR 解决方案的需求。本文研究经典的基于三元组的 SBIR 方案,并表明对水平翻转的持续不变性(即使在模型微调后)正在损害性能。为克服该局限,我们提出若干方法并深入评估每一种以检验其有效性。我们的主要贡献有两点:提出并评估若干直观修改以构建具有更好翻转等变性的 SBIR 方案;表明视觉 Transformer 更适用于 SBIR 任务,且以较大优势超越 CNN。我们进行了大量实验,并引入了在大规模 SBIR 基准(Sketchy)上首次超越人类性能的模型。我们的最佳模型在 Sketchy 基准上实现了 62.25%(k = 1 时)的召回率,而先前最先进方法为 46.2%。
引用
@article{arxiv.2209.06629,
title = {Transformers and CNNs both Beat Humans on SBIR},
author = {Omar Seddati and Stéphane Dupont and Saïd Mahmoudi and Thierry Dutoit},
journal= {arXiv preprint arXiv:2209.06629},
year = {2022}
}