视觉锚点是多模态大语言模型中强大的信息聚合器
计算机视觉与模式识别
2024-11-05 v2
摘要
在多模态大语言模型(MLLMs)领域,视觉-语言连接器在将预训练视觉编码器与大语言模型(LLMs)关联方面发挥着关键作用。尽管其重要性不容置疑,但视觉-语言连接器的研究相对缺乏探索。本研究旨在提出一种强大的视觉-语言连接器,使 MLLMs 能够在保持低计算成本的同时实现高准确率。我们首先揭示了视觉锚点在视觉 Transformer 中的存在,并提出一种成本有效的搜索算法来提取这些锚点。基于这些发现,我们引入 Anchor Former(AcFormer),一种新型视觉-语言连接器,旨在利用这些视觉锚点在预训练期间获得的丰富先验知识,指导信息聚合。通过大量实验,我们展示了所提方法相较于基线方法将计算成本显著降低约三分之二,同时性能超越基线。这凸显了 AcFormer 的有效性与效率。代码已公开 https://github.com/liuhaogeng/Anchor-Former。
引用
@article{arxiv.2405.17815,
title = {Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model},
author = {Haogeng Liu and Quanzeng You and Xiaotian Han and Yongfei Liu and Huaibo Huang and Ran He and Hongxia Yang},
journal= {arXiv preprint arXiv:2405.17815},
year = {2024}
}