极简白盒 Transformer 中分割能力的涌现
计算机视觉与模式识别
2023-09-01 v1 机器学习
摘要
用于视觉任务的类 Transformer 模型近来已被证明对分割和检测等广泛的下游应用有效。先前的工作表明,使用 DINO 等自监督方法训练的视觉 Transformer (ViT) 中会出现分割特性,但在有监督分类任务上训练的 ViT 中则不会。在本研究中,我们探究分割是否在基于 Transformer 的模型中仅仅作为复杂自监督学习机制的结果而出现,还是说通过适当设计模型架构可以在更宽泛的条件下实现同样的涌现。通过大量实验结果,我们证明当采用名为 CRATE 的白盒类 Transformer 架构(其设计显式地对数据分布中的低维结构进行建模并追求之)时,整体与部件层级的分割特性已能在极简的有监督训练方案下涌现。逐层更细粒度的分析揭示,这些涌现特性与白盒网络设计的数学函数高度吻合。我们的结果表明了一条设计同时具备高性能与数学上完全可解释的白盒基础模型的路径。代码见 \url{https://github.com/Ma-Lab-Berkeley/CRATE}。
引用
@article{arxiv.2308.16271,
title = {Emergence of Segmentation with Minimalistic White-Box Transformers},
author = {Yaodong Yu and Tianzhe Chu and Shengbang Tong and Ziyang Wu and Druv Pai and Sam Buchanan and Yi Ma},
journal= {arXiv preprint arXiv:2308.16271},
year = {2023}
}
备注
Code: https://github.com/Ma-Lab-Berkeley/CRATE