中文

视觉 Transformer 中查询引导注意力用于基于单张草图的目标定位

计算机视觉与模式识别 2023-03-16 v1

摘要

在这项工作中,我们研究自然图像上基于草图的目标定位问题,即给定一张物体的粗略手绘草图,目标是在目标图像上定位该物体的所有实例。由于手绘草图的抽象性、草图风格与质量的变化以及草图与自然图像之间存在的巨大领域鸿沟,该问题十分困难。为缓解这些挑战,已有工作提出基于注意力的框架以将查询信息融入图像特征。然而,在这些工作中,查询特征是在图像特征已独立学习之后才被融入,导致对齐不足。相反,我们提出了一种草图引导的视觉 Transformer 编码器,其在基于 Transformer 的图像编码器的每个块之后使用交叉注意力来学习查询条件化的图像特征,从而与查询草图实现更强的对齐。此外,在解码器输出处,物体与草图特征被精炼以将相关物体的表示拉近至草图查询,进而改善定位。所提模型也能泛化至训练时未见过的物体类别,因为我们的方法所学习的目標图像特征是查询感知的。我们的定位框架还可通过一种可训练的新型草图融合策略利用多个草图查询。该模型在来自公开目标检测基准即 MS-COCO 的图像上评估,使用来自 QuickDraw! 和 Sketchy 数据集的草图查询。与现有定位方法相比,所提方法在使用 QuickDraw! 和 Sketchy 数据集草图查询时对可见物体的 mAP 分别提升了 6.6% 和 8.0%,对训练时“未见”大物体的 AP@50 提升了 12.2%。

关键词

引用

@article{arxiv.2303.08784,
  title  = {Query-guided Attention in Vision Transformers for Localizing Objects Using a Single Sketch},
  author = {Aditay Tripathi and Anand Mishra and Anirban Chakraborty},
  journal= {arXiv preprint arXiv:2303.08784},
  year   = {2023}
}