中文

通过解耦语言预训练引导视觉-语言学习

计算机视觉与模式识别 2023-12-21 v4 机器学习

摘要

我们提出一种新颖方法,旨在优化冻结大语言模型(LLMs)在资源密集型视觉-语言(VL)预训练中的应用。当前范式使用视觉特征作为提示来引导语言模型,重点在于确定与相应文本最相关的视觉特征。我们的方法有所不同,集中于语言组件,具体是识别与视觉特征对齐的最优提示。我们引入 Prompt-Transformer(P-Former),一个预测这些理想提示的模型,其仅在语言数据上训练,绕过了对图文配对的需求。该策略将端到端 VL 训练过程微妙地分叉为一个额外的独立阶段。我们的实验表明,我们的框架显著增强了鲁棒的图像到文本基线(BLIP-2)的性能,并有效缩小了使用 4M 与 129M 图文对训练的模型之间的性能差距。重要的是,我们的框架与模态无关且在架构设计上灵活,这已通过在视频学习任务中使用不同基础模块的成功应用得到验证。代码将在 https://github.com/yiren-jian/BLIText 提供。

关键词

引用

@article{arxiv.2307.07063,
  title  = {Bootstrapping Vision-Language Learning with Decoupled Language Pre-training},
  author = {Yiren Jian and Chongyang Gao and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2307.07063},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023 (spotlight). The code is available at https://github.com/yiren-jian/BLIText