中文

BUS:基于自底向上块摘要的高效有效视觉语言预训练

计算机视觉与模式识别 2024-02-27 v2

摘要

基于视觉Transformer(ViT)的视觉语言预训练(VLP)模型在多项任务中展现出令人印象深刻的性能。然而,输入ViT的冗长视觉token序列会导致训练效率低下与效果不佳。现有工作或通过ViT骨干中的底层块提取,或通过外部顶层块抽象来应对该挑战,未能很好地平衡训练效率与效果。受自然语言处理中文本摘要启发,我们提出一种名为BUS的自底向上块摘要方法,协调底层提取与顶层抽象,以高效学习冗长视觉token序列的简洁摘要。具体而言,我们将文本语义感知块选择器(TSPS)嵌入ViT骨干以执行粗粒度视觉token提取,随后在骨干上附加灵活的基于Transformer的块抽象解码器(PAD)用于顶层视觉抽象。这种自底向上协作使我们的BUS在保持甚至提升效果的同时获得高训练效率。我们在多种视觉语言理解与生成任务上评估了该方法,在提升50%训练效率的同时展现出有竞争力的下游任务性能。此外,我们的模型通过提高输入图像分辨率而不增加相比基线的计算成本,在许多下游任务上取得了最先进性能。

关键词

引用

@article{arxiv.2307.08504,
  title  = {BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization},
  author = {Chaoya Jiang and Haiyang Xu and Wei Ye and Qinghao Ye and Chenliang Li and Ming Yan and Bin Bi and Shikun Zhang and Fei Huang and Songfang Huang},
  journal= {arXiv preprint arXiv:2307.08504},
  year   = {2024}
}

备注

Accepted on ICCV2023