Ziya-Visual:通过多任务指令微调的双语大视觉-语言模型
计算与语言
2023-11-01 v3
摘要
近期的进展通过整合多模态输入,扩大了大语言模型(LLM)在零样本图像到文本生成与理解方面的能力。然而,由于缺乏大规模高质量的非英语多模态资源,此类成功通常局限于英语场景,使得在其他语言中建立有竞争力的对应模型极为困难。本文介绍 Ziya-Visual 系列,一组双语大规模视觉-语言模型(LVLM),旨在将视觉语义注入 LLM 以实现多模态对话。我们的模型由 Ziya-Visual-Base 和 Ziya-Visual-Chat 组成,采用来自 BLIP-2 的 Querying Transformer,进一步探索指令微调、多阶段训练和低秩适配模块等优化方案对视觉-语言对齐的辅助作用。此外,我们激发 GPT-4 在多模态场景下的理解能力,将收集的英语图文数据集翻译为中文,并通过上下文学习方法生成指令-回复。实验结果表明,与现有 LVLM 相比,Ziya-Visual 在包括零样本图文检索、图像描述和无视觉问答在内的广泛纯英语任务上取得了有竞争力的性能。由 GPT-4 访问的评估排行榜也表明,我们的模型在中文多模态场景对话中具备令人满意的图像-文本理解与生成能力。代码、演示和模型可在 ~\url{https://huggingface.co/IDEA-CCNL/Ziya-BLIP2-14B-Visual-v1} 获取。
引用
@article{arxiv.2310.08166,
title = {Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning},
author = {Junyu Lu and Dixiang Zhang and Xiaojun Wu and Xinyu Gao and Ruyi Gan and Jiaxing Zhang and Yan Song and Pingjian Zhang},
journal= {arXiv preprint arXiv:2310.08166},
year = {2023}
}