中文

DenseDINO:基于令牌的点级一致性增强密集自监督学习

计算机视觉与模式识别 2023-06-09 v1

摘要

本文提出一种简单而有效的用于自监督学习的Transformer框架DenseDINO,以学习密集视觉表示。为利用密集预测任务所需但被现有自监督Transformer忽视的空间信息,我们以新颖的基于令牌的方式引入跨视图的点级监督。具体而言,DenseDINO引入一些称为参考令牌的额外输入令牌,以利用位置先验匹配点级特征。借助参考令牌,模型能够保持空间一致性并处理多目标复杂场景图像,从而在密集预测任务上具备更好的泛化能力。与原始DINO相比,我们的方法在ImageNet分类评测中取得具有竞争力的性能,并在PascalVOC语义分割的线性探测协议下实现大幅改进(+7.2% mIoU)。

关键词

引用

@article{arxiv.2306.04654,
  title  = {DenseDINO: Boosting Dense Self-Supervised Learning with Token-Based Point-Level Consistency},
  author = {Yike Yuan and Xinghe Fu and Yunlong Yu and Xi Li},
  journal= {arXiv preprint arXiv:2306.04654},
  year   = {2023}
}

备注

IJCAI 2023 accepted