Chat-UniVi:统一视觉表示赋能大语言模型实现图像与视频理解
计算机视觉与模式识别
2024-04-08 v3
摘要
大语言模型已在广泛开放任务中展现出令人印象深刻的通用能力,并将其效用扩展至多模态对话。然而,现有方法在有效处理图像与视频理解(尤其在视觉 token 有限时)方面面临挑战。本文中,我们介绍 Chat-UniVi,一种统一视觉语言模型,能够通过统一视觉表示来理解和参与涉及图像与视频的对话。具体而言,我们采用一组动态视觉 token 统一表示图像和视频。该表示框架使模型能高效利用有限数量的视觉 token,同时捕捉图像所需的空间细节与视频所需的整体时间关系。此外,我们利用多尺度表示,使模型能感知高层语义概念与低层视觉细节。值得注意的是,Chat-UniVi 在包含图像与视频的混合数据集上训练,可直接应用于涉及两种媒介的任务而无需任何修改。大量实验结果表明,Chat-UniVi 持续优于甚至专为图像或视频之一设计的现有方法。代码见 https://github.com/PKU-YuanGroup/Chat-UniVi。
引用
@article{arxiv.2311.08046,
title = {Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding},
author = {Peng Jin and Ryuichi Takanobu and Wancai Zhang and Xiaochun Cao and Li Yuan},
journal= {arXiv preprint arXiv:2311.08046},
year = {2024}
}
备注
Accepted by CVPR 2024 (Highlight)