揭示 STEGO 的内部机制以实现安全无监督语义分割
计算机视觉与模式识别
2023-04-18 v1 人工智能
机器学习
摘要
自监督预训练策略近期在训练计算机视觉中通用特征提取骨干网络方面展现出令人印象深刻的成果。结合 Vision Transformer 架构,DINO 自蒸馏技术具有有趣的涌现特性,例如潜在空间中的无监督聚类以及所生成特征在无显式人工标注标签情况下的语义对应。用于无监督语义分割的 STEGO 方法对比蒸馏 DINO 预训练 Vision Transformer 的特征对应,并近期刷新了最先进水平。然而,STEGO 的详细工作机制尚待厘清,阻碍其在安全关键应用中的使用。本文通过开展研究揭示 STEGO 背后的工作机制、复现并扩展其实验验证、并探究 STEGO 迁移至不同数据集的能力,从而加深对 STEGO 架构与训练策略的理解。结果表明,STEGO 架构可解释为语义保持的降维技术。
引用
@article{arxiv.2304.07314,
title = {Uncovering the Inner Workings of STEGO for Safe Unsupervised Semantic Segmentation},
author = {Alexander Koenig and Maximilian Schambach and Johannes Otterbach},
journal= {arXiv preprint arXiv:2304.07314},
year = {2023}
}
备注
8 Pages + 2 Pages Appendix. Accepted at CVPR 2023 SAIAD Workshop