SPHINX:面向多模态大语言模型的权重、任务与视觉嵌入联合混合
计算机视觉与模式识别
2023-11-14 v1 人工智能
计算与语言
机器学习
摘要
我们提出 SPHINX,一种兼具模型权重、微调任务与视觉嵌入联合混合的多功能多模态大语言模型(MLLM)。首先,为实现更强的视觉-语言对齐,我们在预训练阶段解冻大语言模型(LLM),并引入在真实世界与合成数据训练的 LLM 之间的权重混合策略。通过直接整合两个领域的权重,混合 LLM 能高效吸纳多样语义并具备良好鲁棒性。接着,为实现多用途能力,我们混合多种任务进行联合视觉指令微调,并设计任务专属指令以避免任务间冲突。除基础视觉问答外,我们纳入更具挑战性的任务,如区域级理解、描述定位、文档版面检测与人姿估计,促进不同场景下的相互增强。此外,我们提议从多种网络架构、预训练范式与信息粒度中提取全面视觉嵌入,为语言模型提供更鲁棒的图像表示。基于所提联合混合,SPHINX 在广泛应用上展现出优越的多模态理解能力。在此基础上,我们进一步提出一种高效策略,以更好捕捉高分辨率图像的细粒度外观。通过混合不同尺度与高分辨率子图,SPHINX 在现有评测基准上获得出色的视觉解析与推理性能。我们希望本研究能为未来 MLLM 探索中的联合混合提供启示。代码发布于 https://github.com/Alpha-VLLM/LLaMA2-Accessory。
引用
@article{arxiv.2311.07575,
title = {SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models},
author = {Ziyi Lin and Chris Liu and Renrui Zhang and Peng Gao and Longtian Qiu and Han Xiao and Han Qiu and Chen Lin and Wenqi Shao and Keqin Chen and Jiaming Han and Siyuan Huang and Yichi Zhang and Xuming He and Hongsheng Li and Yu Qiao},
journal= {arXiv preprint arXiv:2311.07575},
year = {2023}
}
备注
Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory