深度 ViT 特征作为稠密视觉描述子
计算机视觉与模式识别
2022-10-18 v3
摘要
我们研究使用从预训练的 Vision Transformer (ViT) 中提取的深度特征作为稠密视觉描述子。我们观察到并通过实验证明,当此类特征从自监督 ViT 模型(DINO-ViT)中提取时,展现出若干引人注目的特性,包括:(i) 这些特征以高空间粒度(如物体部件)编码了强大的、定位良好的语义信息;(ii) 所编码的语义信息在相关但不同的物体类别间共享;以及 (iii) 位置偏置在各层间逐渐变化。这些特性使我们能够针对多种应用设计简单的方法,包括协同分割、部件协同分割和语义对应。为了从错综复杂的设计选择中提炼 ViT 特征的能力,我们仅限于直接应用于特征的轻量级零样本方法(例如分箱与聚类)。由于我们的方法无需额外训练或数据,它们可随时应用于多种领域。我们通过广泛的定性与定量评估表明,我们的简单方法取得了与近期最先进(SOTA)监督方法相竞争的结果,并大幅优于以往的无监督方法。代码见 dino-vit-features.github.io。
引用
@article{arxiv.2112.05814,
title = {Deep ViT Features as Dense Visual Descriptors},
author = {Shir Amir and Yossi Gandelsman and Shai Bagon and Tali Dekel},
journal= {arXiv preprint arXiv:2112.05814},
year = {2022}
}
备注
Revised version - high res figures