中文

从显著性到 DINO:用于少样本关键点检测的显著性引导视觉Transformer

计算机视觉与模式识别 2023-04-07 v1

摘要

与当前训练用于识别有限数量身体部位的深度关键点检测器不同,少样本关键点检测(FSKD)旨在根据参考样本定位任意关键点,包括新颖或基础关键点。FSKD 需要具有语义意义的关系来进行关键点相似性学习,以克服普遍存在的噪声和模糊的局部模式。视觉Transformer(ViT)因其能很好地捕捉长程关系而提供了一种解决思路。然而,由于全局注意力矩阵,ViT 可能对感兴趣区域之外的无关特征建模,从而削弱支持与查询特征之间的相似性学习。本文提出一种新颖的显著性引导视觉Transformer,称为 SalViT,用于少样本关键点检测。我们的 SalViT 具有独特设计的掩码自注意力与形态学学习器,其中前者引入显著性图作为软掩码以约束前景上的自注意力,而后者利用所谓的幂归一化来调整显著性图的形态,实现“动态变化的感受野”。此外,由于显著性检测器会增加计算量,我们表明 DINO Transformer 的注意力掩码可替代显著性。在 SalViT 之上,我们还研究了 i) 利用无标签数据增强关键点表示的转导式 FSKD,以及 ii) 遮挡下的 FSKD。我们表明,我们的模型在五个公开数据集上表现良好,并在严重遮挡下比常规训练的模型 PCK 高出约 10%。

关键词

引用

@article{arxiv.2304.03140,
  title  = {From Saliency to DINO: Saliency-guided Vision Transformer for Few-shot Keypoint Detection},
  author = {Changsheng Lu and Hao Zhu and Piotr Koniusz},
  journal= {arXiv preprint arXiv:2304.03140},
  year   = {2023}
}

备注

15 pages, 10 figures