中文

用于弹性高效视觉问答的双侧可瘦Transformer

计算机视觉与模式识别 2023-05-15 v2

摘要

近期Transformer架构[1]的进展为视觉问答(VQA)带来了显著提升。然而,基于Transformer的VQA模型通常较深且较宽以保证良好性能,因此只能在强大的GPU服务器上运行,无法在手机等容量受限平台上运行。因此,有必要学习一个弹性VQA模型,支持在运行时自适应剪枝以满足不同平台的效率约束。为此,我们提出双侧可瘦Transformer(BST),这是一个通用框架,可无缝集成到任意基于Transformer的VQA模型中,一次性训练单个模型并获得不同宽度和深度的多种瘦身子模型。为验证该方法的有效性和通用性,我们将所提BST框架与三种典型的基于Transformer的VQA方法(即MCAN[2]、UNITER[3]和CLIP-ViL[4])集成,并在两个常用基准数据集上进行大量实验。特别地,一个瘦身MCAN-BST子模型在VQA-v2上取得了可比精度,而模型大小仅为参考MCAN模型的0.38倍、FLOPs减少至0.27倍。最小的MCAN-BST子模型推理时仅有9M参数和0.16G FLOPs,使其能以低于60 ms延迟部署在移动设备上。

关键词

引用

@article{arxiv.2203.12814,
  title  = {Bilaterally Slimmable Transformer for Elastic and Efficient Visual Question Answering},
  author = {Zhou Yu and Zitian Jin and Jun Yu and Mingliang Xu and Hongbo Wang and Jianping Fan},
  journal= {arXiv preprint arXiv:2203.12814},
  year   = {2023}
}

备注

Accepted at IEEE Transactions on Multimedia, 2023. Code available at https://github.com/MILVLG/bst