轻量级视觉 Transformer 能有多轻
计算机视觉与模式识别
2024-07-26 v1 人工智能
摘要
本文探讨了一种利用混合专家 (Mixture-of-Experts, MoE) 来精简视觉 Transformer 的策略,而非增强其性能。每个 MoE 层中的专家均为 SwiGLU 前馈网络,其中 V 和 W2 在该层共享。未采用任何复杂的注意力或卷积机制。应用深度比例缩放,逐步减小隐藏层大小,并在阶段性增加专家数量。采用分组查询注意力。我们研究了该方法在有无在小数据集上预训练以及在此规模下迁移学习是否可行。我们发现,该架构在 0.67 万参数规模下仍具竞争力。
引用
@article{arxiv.2407.17783,
title = {How Lightweight Can A Vision Transformer Be},
author = {Jen Hong Tan},
journal= {arXiv preprint arXiv:2407.17783},
year = {2024}
}