面向视觉推理任务的高效视觉-语言对齐:基于 Q-Former 的研究
计算与语言
2024-10-15 v1
摘要
最新进展表明,大语言模型通过引入额外编码器来对齐不同模态,展现了在视觉推理任务中的增强能力。虽然 Q-Former 已被广泛用作对齐图像、视频、音频和 3D 数据与大语言模型的通用编码器,但其高效训练及各组成部分分析的相关工作仍有限。本文我们利用 InstructBLIP 对 Q-Former 进行参数高效微调 (PEFT),并在 ScienceQA 和 IconQA 等视觉推理基准上进行测试。我们观察到,对 Q-Former 应用 PEFT 可在可训练参数不足 2% 的情况下获得与全参数微调相当的性能。此外,我们采用 AdaLoRA 进行动态参数预算重新分配,以评估 Q-Former 各子层在 4 个不同基准上的相对重要性。我们的发现表明,自注意力层在感知式视觉-语言推理任务中尤为重要,FFN 层的相对重要性取决于任务中视觉-语言模式的复杂度。代码已公开于 https://github.com/AttentionX/InstructBLIP_PEFT。
引用
@article{arxiv.2410.09489,
title = {Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks},
author = {Sungkyung Kim and Adam Lee and Junyoung Park and Andrew Chung and Jusang Oh and Jay-Yoon Lee},
journal= {arXiv preprint arXiv:2410.09489},
year = {2024}
}
备注
EMNLP 2024 Findings