SPAE:用于冻结大语言模型多模态生成的语义金字塔自编码器
计算机视觉与模式识别
2023-10-31 v3 计算与语言
多媒体
摘要
在本工作中,我们提出了语义金字塔自编码器(Semantic Pyramid AutoEncoder, SPAE),以使冻结的大语言模型(LLM)能够执行涉及图像或视频等非语言模态的理解与生成任务。SPAE 在原始像素与从 LLM 词表中提取的可解释词元(或单词)之间进行转换。所得词元既捕获了语义信息,也保留了视觉重建所需的细粒度细节,有效地将视觉内容转化为 LLM 可理解的语言,并使其能执行多种多模态任务。我们的方法通过在冻结的 PaLM 2 和 GPT 3.5 上针对一组多样的图像理解与生成任务进行上下文学习实验得到了验证。在相同设置下,我们的方法标志着首次成功使冻结 LLM 生成图像内容,同时在图像理解任务上超越最先进(SOTA)性能超过 25%。
引用
@article{arxiv.2306.17842,
title = {SPAE: Semantic Pyramid AutoEncoder for Multimodal Generation with Frozen LLMs},
author = {Lijun Yu and Yong Cheng and Zhiruo Wang and Vivek Kumar and Wolfgang Macherey and Yanping Huang and David A. Ross and Irfan Essa and Yonatan Bisk and Ming-Hsuan Yang and Kevin Murphy and Alexander G. Hauptmann and Lu Jiang},
journal= {arXiv preprint arXiv:2306.17842},
year = {2023}
}
备注
NeurIPS 2023 spotlight