PandaGPT:一个遵循所有指令的模型
计算与语言
2023-05-29 v1 计算机视觉与模式识别
摘要
我们提出 PandaGPT,一种赋予大语言模型视觉与听觉指令遵循能力的方法。我们的初步实验表明,PandaGPT 能够执行复杂任务,如生成详尽的图像描述、创作受视频启发的故事,以及回答有关音频的问题。更有趣的是,PandaGPT 可以同时接收多模态输入并自然地组合其语义。例如,PandaGPT 能够将图像/视频中物体的外观与音频中它们的声音联系起来。为此,PandaGPT 结合了来自 ImageBind 的多模态编码器和来自 Vicuna 的大语言模型。值得注意的是,PandaGPT 的训练仅需对齐的图像-文本对。得益于 ImageBind 将不同模态数据嵌入同一空间的强大能力,PandaGPT 对图像和文本之外的数据(如视频、音频、深度、热成像和 IMU)展现出涌现的即零样本跨模态行为。我们希望 PandaGPT 能作为构建如人类般整体感知和理解不同模态输入的 AGI 的初步一步。我们的项目页面位于 https://panda-gpt.github.io/。
引用
@article{arxiv.2305.16355,
title = {PandaGPT: One Model To Instruction-Follow Them All},
author = {Yixuan Su and Tian Lan and Huayang Li and Jialu Xu and Yan Wang and Deng Cai},
journal= {arXiv preprint arXiv:2305.16355},
year = {2023}
}
备注
Technical report, work in progress. Our project page is at https://panda-gpt.github.io/