空间熵作为视觉变换器的归纳偏置
计算机视觉与模式识别
2023-03-15 v3 机器学习
摘要
近期关于视觉变换器(VTs)的研究表明,在 VT 架构中引入局部归纳偏置有助于减少训练所需样本数。然而,架构修改导致 Transformer 主干的通用性丧失,部分违背了朝向统一架构(例如被计算机视觉与自然语言处理领域共享)发展的趋势。本工作中,我们提出一种不同且互补的思路:利用与标准监督训练联合执行的辅助自监督任务来引入局部偏置。具体而言,我们借助如下观察——以自监督训练的 VTs 其注意力图可包含语义分割结构,而该结构在纯监督训练中不会自发涌现——从而显式鼓励这种空间聚类的涌现以作为训练正则化形式。更详细地,我们利用如下假设:在给定图像中,物体通常对应于少数连通区域,并据此提出信息熵的空间表述以量化这种基于物体的归纳偏置。通过最小化所提空间熵,我们在训练中引入了额外的自监督信号。大量实验表明,所提正则化取得了与通过更改基础 Transformer 架构来引入局部偏置的其他 VT 方案等效或更好的结果,并且在使用中小规模训练集时可大幅提升 VT 的最终准确率。代码见 https://github.com/helia95/SAR。
引用
@article{arxiv.2206.04636,
title = {Spatial Entropy as an Inductive Bias for Vision Transformers},
author = {Elia Peruzzo and Enver Sangineto and Yahui Liu and Marco De Nadai and Wei Bi and Bruno Lepri and Nicu Sebe},
journal= {arXiv preprint arXiv:2206.04636},
year = {2023}
}