通过引入局部归纳偏置提升视觉Transformer在小数据集上的性能
计算机视觉与模式识别
2023-05-16 v1 人工智能
摘要
视觉Transformer(ViTs)在大型数据集上取得了卓越性能,但在较小数据集上从头训练时往往表现不如卷积神经网络(CNNs),这可能是由于架构中缺乏局部归纳偏置。因此,近期研究向架构中加入了局部性,并证明它可以帮助 ViTs 在小规模数据集场景下达到与 CNNs 相当的性能。然而,现有方法是架构特定的,或具有更高的计算和内存成本。为此,我们提出了一个称为局部信息增强器(Local InFormation Enhancer, LIFE)的模块,该模块提取块级局部信息并将其整合到 ViTs 自注意力块所使用的嵌入中。我们提出的模块在内存和计算上高效,并且足够灵活以处理如分类和蒸馏令牌等辅助令牌。实证结果表明,添加 LIFE 模块提升了 ViTs 在小图像分类数据集上的性能。我们进一步展示了该效果可扩展到下游任务,如目标检测和语义分割。此外,我们引入了一种新的可视化方法——稠密注意力展开(Dense Attention Roll-Out),专为稠密预测任务设计,可利用所有令牌的注意力图生成类特定的注意力图。
引用
@article{arxiv.2305.08551,
title = {Enhancing Performance of Vision Transformers on Small Datasets through Local Inductive Bias Incorporation},
author = {Ibrahim Batuhan Akkaya and Senthilkumar S. Kathiresan and Elahe Arani and Bahram Zonooz},
journal= {arXiv preprint arXiv:2305.08551},
year = {2023}
}