认知视觉 - 语言映射器:通过增强视觉知识对齐推进多模态理解
计算与语言
2024-06-27 v2 计算机视觉与模式识别
摘要
在评估和反思大型多模态模型 (LMMs) 的现状时,我们观察到广泛使用的视觉 - 语言投影方法(例如 Q-former 或 MLP)侧重于图像 - 文本描述的对齐,却忽视了视觉知识维度的对齐,即将视觉内容与相关知识联系起来。视觉知识在分析、推断和解读视觉信息方面发挥着重要作用,有助于提高基于知识的视觉问题回答的准确性。在本文中,我们主要探索通过视觉 - 语言知识对齐来改进 LMMs,特别是针对具有挑战性的基于知识的视觉问答 (VQA)。为此,我们提出了认知视觉 - 语言映射器 (CVLM),其包含一个预训练的视觉知识对齐器 (VKA) 和一个用于多模态指令微调阶段的细粒度知识适配器 (FKA)。具体而言,我们基于小型语言模型与视觉编码器之间的交互设计了 VKA,并在收集的图像 - 知识对上对其进行训练,以实现视觉知识的获取与投影。FKA 用于蒸馏图像的细粒度视觉知识并将其注入大型语言模型 (LLMs) 中。我们在基于知识的 VQA 基准上进行了大量实验,实验结果表明 CVLM 显著提高了 LMMs 在基于知识的 VQA 上的性能(平均提升 5.0%)。消融研究也分别验证了 VKA 和 FKA 的有效性。代码地址:https://github.com/HITsz-TMG/Cognitive-Visual-Language-Mapper
引用
@article{arxiv.2402.13561,
title = {Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment},
author = {Yunxin Li and Xinyu Chen and Baotian Hu and Haoyuan Shi and Min Zhang},
journal= {arXiv preprint arXiv:2402.13561},
year = {2024}
}
备注
12 pages,4 figures; Accepted by ACL 2024 Main Conference