CogVLM2: 面向图像与视频理解的视觉语言模型
计算机视觉与模式识别
2024-08-30 v1
摘要
从 VisualGLM 和 CogVLM 开始,我们持续探索视觉语言模型,以追求更强的视觉-语言融合、高效的高分辨率架构以及更广泛的模态与应用。在此,我们提出 CogVLM2 系列,这是新一代面向图像与视频理解的视觉语言模型,包括 CogVLM2、CogVLM2-Video 和 GLM-4V。作为图像理解模型,CogVLM2 继承了视觉专家架构,并在预训练和后训练阶段改进了训练策略,支持高达 像素的输入分辨率。作为视频理解模型,CogVLM2-Video 集成了带时间戳的多帧输入,并提出了自动化的时间定位数据构建方法。值得注意的是,CogVLM2 系列在 MMBench、MM-Vet、TextVQA、MVBench 和 VCGBench 等基准测试中取得了最先进的结果。所有模型均已开源,地址为 https://github.com/THUDM/CogVLM2 和 https://github.com/THUDM/GLM-4,以推动该领域的发展。
引用
@article{arxiv.2408.16500,
title = {CogVLM2: Visual Language Models for Image and Video Understanding},
author = {Wenyi Hong and Weihan Wang and Ming Ding and Wenmeng Yu and Qingsong Lv and Yan Wang and Yean Cheng and Shiyu Huang and Junhui Ji and Zhao Xue and Lei Zhao and Zhuoyi Yang and Xiaotao Gu and Xiaohan Zhang and Guanyu Feng and Da Yin and Zihan Wang and Ji Qi and Xixuan Song and Peng Zhang and Debing Liu and Bin Xu and Juanzi Li and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2408.16500},
year = {2024}
}