中文

CrossATNet——一种基于跨注意力机制的草图检索图像新框架

计算机视觉与模式识别 2021-04-22 v1 机器学习

摘要

我们提出了一种用于草图检索图像(SBIR)中跨模态零样本学习(ZSL)的新框架。通常,SBIR 框架主要考虑两个图像视图与语义侧信息之间的同时映射。因此,期望主要在草图域中使用具有高判别力和语义丰富特征空间的细粒度类别。然而,现有的基于深度生成建模的 SBIR 方法主要通过生成伪未见类样本来弥合可见类与未见类之间的差距。此外,此类技术在训练时未利用任何未见类信息,违反了 ZSL 协议,且未显式关注共享空间的判别性建模。我们还注意到,考虑到草图与彩色图像之间的显著域差异,为多视图视觉数据学习统一特征空间是一项繁琐任务。对此,作为补救,我们引入了一种用于零样本 SBIR 的新框架。在定义跨模态三元组损失以确保共享空间判别性的同时,还提出了一种创新的跨模态注意力学习策略,利用各自草图对应物的信息来引导图像域的特征提取。为保持共享空间的语义一致性,我们考虑了一个基于图 CNN 的模块,将语义类拓扑传播到共享空间。为确保推理时改进的响应时间,我们进一步探索了用哈希码表示共享空间的可能性。在基准 TU-Berlin 和 Sketchy 数据集上获得的实验结果证实了 CrossATNet 在取得最优结果方面的优越性。

关键词

引用

@article{arxiv.2104.09918,
  title  = {CrossATNet - A Novel Cross-Attention Based Framework for Sketch-Based Image Retrieval},
  author = {Ushasi Chaudhuri and Biplab Banerjee and Avik Bhattacharya and Mihai Datcu},
  journal= {arXiv preprint arXiv:2104.09918},
  year   = {2021}
}

备注

Accepted in Journal of Image and Vision Computing