CogVLM:面向预训练语言模型的视觉专家
计算机视觉与模式识别
2024-02-06 v2
摘要
我们提出CogVLM,一个强大的开源视觉语言基础模型。与将图像特征映射到语言模型输入空间的流行浅层对齐方法不同,CogVLM通过在注意力与FFN层中引入可训练的视觉专家模块,弥合了冻结的预训练语言模型与图像编码器之间的鸿沟。因此,CogVLM实现了视觉语言特征的深度融合,且不牺牲任何NLP任务上的性能。CogVLM-17B在10个经典跨模态基准上取得最先进性能,包括NoCaps、Flicker30k captioning、RefCOCO、RefCOCO+、RefCOCOg、Visual7W、GQA、ScienceQA、VizWiz VQA和TDIUC,并在VQAv2、OKVQA、TextVQA、COCO captioning等上排名第二,超越或匹敌PaLI-X 55B。代码与检查点发布于https://github.com/THUDM/CogVLM。
引用
@article{arxiv.2311.03079,
title = {CogVLM: Visual Expert for Pretrained Language Models},
author = {Weihan Wang and Qingsong Lv and Wenmeng Yu and Wenyi Hong and Ji Qi and Yan Wang and Junhui Ji and Zhuoyi Yang and Lei Zhao and Xixuan Song and Jiazheng Xu and Bin Xu and Juanzi Li and Yuxiao Dong and Ming Ding and Jie Tang},
journal= {arXiv preprint arXiv:2311.03079},
year = {2024}
}