中文

TRIPS:基于文本相关图像块选择的高效视觉与语言预训练

计算机视觉与模式识别 2025-09-30 v4 人工智能

摘要

Vision Transformers (ViTs) 已被广泛用于大规模视觉与语言预训练 (VLP) 模型。尽管以往的 VLP 工作已证明了 ViTs 的有效性,但它们仍受限于长视觉序列带来的计算效率问题。为解决该问题,本文提出一种高效的视觉与语言预训练模型,采用\textbf{T}ext-\textbf{R}elevant \textbf{I}mage \textbf{P}atch \textbf{S}election(文本相关图像块选择,简称 TRIPS),其在视觉骨干网络中通过文本引导的图像块选择层逐步缩减视觉序列,以实现高效训练与推理。该图像块选择层可动态计算文本依赖的视觉注意力,在文本引导下识别受关注的图像 token,并以端到端方式融合不受关注的 token。同时,TRIPS 未向 ViTs 引入额外参数。在多种流行基准数据集上的实验结果表明,TRIPS 相较以往同类 VLP 模型获得 40% 的加速,且在下游任务性能上具竞争力或更优。

关键词

引用

@article{arxiv.2305.04474,
  title  = {TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection},
  author = {Chaoya Jiang and Haiyang Xu and Chenliang Li and Miang Yan and Wei Ye and Shikun Zhang and Bin Bi and Songfang Huang},
  journal= {arXiv preprint arXiv:2305.04474},
  year   = {2025}
}

备注

Accepted by EMNLP2022