PaLM2-VAdapter:渐进对齐的语言模型构建强大的视觉 - 语言适配器
计算机视觉与模式识别
2024-06-04 v2
摘要
本文证明,渐进对齐的语言模型可以有效地桥接冻结的视觉编码器和大型语言模型(LLMs)。虽然视觉编码器和 LLMs 的基础架构及预训练方法已被广泛研究,但视觉 - 语言适配器的架构和训练策略在最近的工作中差异显著。我们的研究对最先进的感知器重采样器(perceiver resampler)架构进行了彻底探索并建立了强大的基线。然而,我们观察到,缺乏直接监督的感知器重采样器在视觉 - 语言对齐方面表现出收敛缓慢和可扩展性有限的问题。为解决此问题,我们提出了 PaLM2-VAdapter,采用渐进对齐的语言模型作为视觉 - 语言适配器。与具有感知器重采样器的强基线相比,我们的方法在经验上显示出更快的收敛速度、更高的性能和更强的可扩展性。在图像和视频上的各种视觉问答(VQA)和字幕生成任务中进行的广泛实验表明,我们的模型展现了最先进的视觉理解和多模态推理能力。值得注意的是,我们的方法在参数量比最先进的大型视觉 - 语言模型少 30~70% 的情况下实现了这些进步,标志着效率的显著提升。
引用
@article{arxiv.2402.10896,
title = {PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter},
author = {Junfei Xiao and Zheng Xu and Alan Yuille and Shen Yan and Boyu Wang},
journal= {arXiv preprint arXiv:2402.10896},
year = {2024}
}
备注
Technical report, 15 pages; v2 fix typos, add additional results in appendix