BUS:基于自底向上块摘要的高效有效视觉语言预训练
计算机视觉与模式识别
2024-02-27 v2
摘要
基于视觉Transformer(ViT)的视觉语言预训练(VLP)模型在多项任务中展现出令人印象深刻的性能。然而,输入ViT的冗长视觉token序列会导致训练效率低下与效果不佳。现有工作或通过ViT骨干中的底层块提取,或通过外部顶层块抽象来应对该挑战,未能很好地平衡训练效率与效果。受自然语言处理中文本摘要启发,我们提出一种名为BUS的自底向上块摘要方法,协调底层提取与顶层抽象,以高效学习冗长视觉token序列的简洁摘要。具体而言,我们将文本语义感知块选择器(TSPS)嵌入ViT骨干以执行粗粒度视觉token提取,随后在骨干上附加灵活的基于Transformer的块抽象解码器(PAD)用于顶层视觉抽象。这种自底向上协作使我们的BUS在保持甚至提升效果的同时获得高训练效率。我们在多种视觉语言理解与生成任务上评估了该方法,在提升50%训练效率的同时展现出有竞争力的下游任务性能。此外,我们的模型通过提高输入图像分辨率而不增加相比基线的计算成本,在许多下游任务上取得了最先进性能。
引用
@article{arxiv.2307.08504,
title = {BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization},
author = {Chaoya Jiang and Haiyang Xu and Wei Ye and Qinghao Ye and Chenliang Li and Ming Yan and Bin Bi and Shikun Zhang and Fei Huang and Songfang Huang},
journal= {arXiv preprint arXiv:2307.08504},
year = {2024}
}
备注
Accepted on ICCV2023