中文

基于多层特征聚合的空间感知高效投影器,用于MLLMs

计算机视觉与模式识别 2024-10-15 v1 多媒体

摘要

投影器在多模态语言模型(MLLMs)中才作用着关键角色。其输出的视觉token数量影响MLLMs的效率,而视觉token质量则影响MLLMs的视觉理解能力。当前对投影器的探索主要聚焦于减少视觉token数量以提高效率,常常忽视了序列化的2维视觉token序列与自然语言token序列之间固有的空间差异。提出了空间感知高效投影器(SAEP)以解决此问题。具体而言,我们的SAEP方法在多层视觉特征上采用修改后的深度可分离卷积模块,以增强视觉token的空间信息。结果Our SAEP方法不仅可以将视觉token数量大幅减少75%,而且显著提升了MLLMs的多模态空间理解能力。此外,与现有投影器相比,我们的SAEP在大规模多模态评估基准中取得最佳性能,这表明其在弥合模态差距方面的有效性。

关键词

引用

@article{arxiv.2410.10319,
  title  = {Spatial-Aware Efficient Projector for MLLMs via Multi-Layer Feature Aggregation},
  author = {Shun Qian and Bingquan Liu and Chengjie Sun and Zhen Xu and Baoxun Wang},
  journal= {arXiv preprint arXiv:2410.10319},
  year   = {2024}
}

备注

10 pages, 3 figures