面向通用多模态助手重构视觉-语言基础模型与数据集
计算机视觉与模式识别
2023-10-03 v1 人工智能
摘要
近期的多模态大语言模型(MLLM)展现出感知图像和遵循开放式指令的惊人能力。MLLM的能力取决于两个关键因素:促进视觉模块与大语言模型特征对齐的模型架构;用于人类指令遵循的多模态指令微调数据集。(i) 对于模型架构,大多数现有模型引入外部桥接模块以连接视觉编码器与语言模型,这需要额外的特征对齐预训练。在本工作中,我们发现紧凑的预训练视觉-语言模型可天然充当视觉与语言之间“开箱即用”的桥梁。基于此,我们提出Muffin框架,其直接采用预训练视觉-语言模型作为视觉信号的提供者。(ii) 对于多模态指令微调数据集,现有方法忽略不同数据集间的互补关系,只是简单混合来自不同任务的数据集。相反,我们提出UniMM-Chat数据集,其探索数据集的互补性以生成110万条高质量且多样的多模态指令。我们合并来自不同数据集描述同一图像的信息,并将其转化为知识更密集的对话数据。实验结果证明了Muffin框架与UniMM-Chat数据集的有效性。Muffin在广泛的视觉-语言任务上取得最先进性能,显著超越LLaVA和InstructBLIP等最先进模型。我们的模型与数据集均可在 https://github.com/thunlp/muffin 获取。
引用
@article{arxiv.2310.00653,
title = {Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants},
author = {Tianyu Yu and Jinyi Hu and Yuan Yao and Haoye Zhang and Yue Zhao and Chongyi Wang and Shan Wang and Yinxv Pan and Jiao Xue and Dahai Li and Zhiyuan Liu and Hai-Tao Zheng and Maosong Sun},
journal= {arXiv preprint arXiv:2310.00653},
year = {2023}
}