中文

利用差异注意力学习视觉接地的自监督表征

计算机视觉与模式识别 2023-06-27 v1

摘要

自监督学习(SSL)的近期工作在单目标图像上展示了令人印象深刻的成果,但在复杂多目标图像上表现不佳,其薄弱的视觉接地能力即为佐证。为具体说明这一点,我们提出视觉差异注意力(VDA),通过将该图像与其显著区域被掩去的版本进行比较,以无监督方式计算视觉注意力图。我们利用 VDA 为最先进的 SSL 方法推导注意力图,并显示它们无法准确高亮图像中的所有显著区域,表明其难以为分割等下游任务学习强表征。受这些局限性的启发,我们将 VDA 构建为一个可微操作,并提出一个新的学习目标——可微差异注意力(DiDA)损失,它显著提升了 SSL 模型对图像显著区域的视觉接地能力。

关键词

引用

@article{arxiv.2306.14603,
  title  = {Learning with Difference Attention for Visually Grounded Self-supervised Representations},
  author = {Aishwarya Agarwal and Srikrishna Karanam and Balaji Vasan Srinivasan},
  journal= {arXiv preprint arXiv:2306.14603},
  year   = {2023}
}

备注

15 pages, 14 figures