切片递归Transformer
计算机视觉与模式识别
2022-07-27 v3 人工智能
机器学习
摘要
我们提出了一种简洁而有效的视觉Transformer递归操作,可在不引入额外参数的情况下改善参数利用。这是通过跨Transformer网络深度共享权重实现的。所提方法仅使用朴素递归操作即可获得显著提升(约2%),无需特殊或复杂的网络设计原理知识,并为训练过程引入最小的计算开销。为减少递归操作引起的额外计算同时保持优越精度,我们提出了一种跨递归层的多重切片分组自注意力近似方法,可将消耗成本降低10~30%且性能损失极小。我们称我们的模型为切片递归Transformer(SReT),一种新颖且参数高效的视觉Transformer设计,兼容多种其他高效ViT架构设计。我们的最佳模型在ImageNet-1K上以更少参数显著优于最先进方法。所提切片递归结构的权重共享机制使我们能够轻松构建具有超过100甚至1000个共享层的Transformer,同时保持紧凑规模(13~15M),以避免模型过大时的优化困难。这种灵活的可扩展性已展现出扩展模型与构建极深视觉Transformer的巨大潜力。代码见https://github.com/szq0214/SReT。
引用
@article{arxiv.2111.05297,
title = {Sliced Recursive Transformer},
author = {Zhiqiang Shen and Zechun Liu and Eric Xing},
journal= {arXiv preprint arXiv:2111.05297},
year = {2022}
}
备注
ECCV 2022, 31 pages with Appendix. Code and models are available at https://github.com/szq0214/SReT (v3: update license and fix arxiv timestamp)