SwitchGPT:将大语言模型适配于非文本输出
计算机视觉与模式识别
2023-09-15 v1
摘要
大语言模型(LLMs)主要在基于文本的数据集上训练,通过文本输出展现出了理解和执行复杂语言指令的卓越能力。然而,当被要求生成非文本输出时,它们表现不佳。同时,文本到图像等模态转换模型尽管能生成高质量图像,却缺乏广泛的文本预训练。因此,这些模型只能接受特定的图像描述,而无法理解更复杂的指令。为弥补这一差距,我们从模态转换的视角提出一种新方法 SwitchGPT,将基于文本的 LLM 演进为多模态模型。我们特别使用极少量数据集来指导 LLM 识别指令所指向的输出模态。因此,适配后的 LLM 可有效调用模型库中的各种现成模态转换模型来生成非文本响应。这规避了通常需要海量配对多模态数据的复杂预训练,同时继承了 LLM 的广博知识与高质量生成模型的能力。为评估并与传统对应模型比较该适配多模态 LLM,我们构建了一个征询多样模态输出的多模态指令基准。实验结果表明,经极少训练,LLM 便可便捷地适配以理解非文本响应请求,从而在多模态场景中实现更高灵活性。代码与数据将发布于 https://github.com/xinke-wang/SwitchGPT。
引用
@article{arxiv.2309.07623,
title = {SwitchGPT: Adapting Large Language Models for Non-Text Outputs},
author = {Xinyu Wang and Bohan Zhuang and Qi Wu},
journal= {arXiv preprint arXiv:2309.07623},
year = {2023}
}