结合文本相关图像块选择的高效视觉与语言预训练
计算机视觉与模式识别
2024-03-14 v1 人工智能
摘要
Vision Transformers (ViTs) 在大规模视觉与语言预训练 (VLP) 模型中日益普及。尽管以往的 VLP 研究已证明 ViTs 的有效性,但这些工作仍因冗长的视觉序列而面临计算效率低下的问题。为应对这一挑战,我们引入了一种名为 TRIPS(Text-Relevant Image Patch Selection,文本相关图像块选择)的高效 VLP 方法。TRIPS 在视觉主干网络中使用文本引导的图像块选择层来逐步缩减视觉序列,从而加速训练和推理过程。该图像块选择层动态计算依赖文本的视觉注意力,使其能够在文本引导下识别出受关注的图像 token,并以端到端的方式融合不受关注的 token。重要的是,TRIPS 不增加任何额外参数,并且可推广至大多数基于 ViT 的 VLP 模型。我们将 TRIPS 融入涵盖单流、双流和生成式范式的三个代表性 VLP 模型中,并在五个广泛使用的多模态基准数据集上进行了大量实验。实验结果表明,TRIPS 在实现 40% 加速的同时,在下游任务中保持了具有竞争力或更优的性能。
引用
@article{arxiv.2403.07883,
title = {Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection},
author = {Wei Ye and Chaoya Jiang and Haiyang Xu and Chenhao Ye and Chenliang Li and Ming Yan and Shikun Zhang and Songhang Huang and Fei Huang},
journal= {arXiv preprint arXiv:2403.07883},
year = {2024}
}