ViR:迈向高效的视觉保留骨干网络
计算机视觉与模式识别
2024-01-29 v2 人工智能
机器学习
摘要
视觉Transformer(ViTs)近年来备受青睐,因其在建模长程空间依赖方面的卓越能力以及对大规模训练的可扩展性。尽管自注意力机制的训练并行性在保持优异性能方面发挥重要作用,其二次复杂度阻碍了ViTs在许多需要快速推理场景中的应用。在需要输入特征自回归建模的应用中,这一影响更为显著。在自然语言处理(NLP)中,新一波研究提出了具有循环公式的可并行化模型,可在生成式应用中实现高效推理。受此趋势启发,我们提出一类新的计算机视觉模型,称为视觉保留网络(ViR),具有双重并行与循环公式,在快速推理与并行训练及具竞争力的性能之间取得最优平衡。特别地,由于其在处理大序列长度时的灵活公式,ViR在需要更高分辨率图像的任务中于图像吞吐量和内存消耗方面表现良好。ViR是首个在用于识别任务的通用视觉骨干中实现双重并行与循环等价性的尝试。我们通过不同数据集规模和多种图像分辨率的广泛实验验证了ViR的有效性,并取得了具竞争力的性能。代码:https://github.com/NVlabs/ViR
引用
@article{arxiv.2310.19731,
title = {ViR: Towards Efficient Vision Retention Backbones},
author = {Ali Hatamizadeh and Michael Ranzinger and Shiyi Lan and Jose M. Alvarez and Sanja Fidler and Jan Kautz},
journal= {arXiv preprint arXiv:2310.19731},
year = {2024}
}
备注
Introduction of Vision Retention Networks (ViR) for Efficient Visual Modeling