利用差异注意力学习视觉接地的自监督表征
计算机视觉与模式识别
2023-06-27 v1
摘要
自监督学习(SSL)的近期工作在单目标图像上展示了令人印象深刻的成果,但在复杂多目标图像上表现不佳,其薄弱的视觉接地能力即为佐证。为具体说明这一点,我们提出视觉差异注意力(VDA),通过将该图像与其显著区域被掩去的版本进行比较,以无监督方式计算视觉注意力图。我们利用 VDA 为最先进的 SSL 方法推导注意力图,并显示它们无法准确高亮图像中的所有显著区域,表明其难以为分割等下游任务学习强表征。受这些局限性的启发,我们将 VDA 构建为一个可微操作,并提出一个新的学习目标——可微差异注意力(DiDA)损失,它显著提升了 SSL 模型对图像显著区域的视觉接地能力。
引用
@article{arxiv.2306.14603,
title = {Learning with Difference Attention for Visually Grounded Self-supervised Representations},
author = {Aishwarya Agarwal and Srikrishna Karanam and Balaji Vasan Srinivasan},
journal= {arXiv preprint arXiv:2306.14603},
year = {2023}
}
备注
15 pages, 14 figures