HSViT:水平可扩展视觉 Transformer
计算机视觉与模式识别
2024-07-17 v2
摘要
由于缺乏先验知识(归纳偏置),视觉 Transformer(ViT)需要在大规模数据集上进行预训练才能表现良好。此外,ViT 模型中不断增加的层数和参数量阻碍了其在计算资源有限的设备上的适用性。为了缓解上述挑战,本文引入了一种新颖的水平可扩展视觉 Transformer(HSViT)方案。具体而言,一种新颖的图像级特征嵌入被引入到 ViT 中,其中保留的归纳偏置使得模型无需预训练,同时在小数据集上表现更佳。此外,设计了一种新颖的水平可扩展架构,促进了跨多个计算设备的协作模型训练和推理。实验结果表明,在无需预训练的情况下,HSViT 在小数据集上的 top-1 准确率比最先进的方案高出 10%,同时在 ImageNet 上为现有的 CNN 主干网络提供了高达 3.1% 的 top-1 准确率提升。代码可在 https://github.com/xuchenhao001/HSViT 获取。
引用
@article{arxiv.2404.05196,
title = {HSViT: Horizontally Scalable Vision Transformer},
author = {Chenhao Xu and Chang-Tsun Li and Chee Peng Lim and Douglas Creighton},
journal= {arXiv preprint arXiv:2404.05196},
year = {2024}
}