中文

大语言模型与多模态生成与编辑:综述

人工智能 2024-06-11 v2 计算与语言 计算机视觉与模式识别 多媒体 声音

摘要

随着大型语言模型 (LLM) 的近期发展,越来越多的人关注将 LLM 与多模态学习结合起来。以前的多模态大语言模型 (MLLM) 调查主要聚焦于多模态理解。本综述涵盖图像、视频、3D 和音频等各种领域的多模态生成和编辑。具体而言,我们总结了这些领域的重要进展,并将这些研究分为基于 LLM 的方法和基于 CLIP/T5 的方法。然后,我们总结了 LLM 在多模态生成中发挥的各种作用,并详尽地探讨了这些方法背后的关键技术组件以及这些研究所利用的多模态数据集。此外,我们调查了能够利用现有生成模型进行人机交互的工具增强型多模态智能体。最后,我们讨论了生成式 AI 安全领域的进展,探讨了新兴应用,并就未来展望展开讨论。我们的工作提供了多模态生成和处理的系统性和洞见性概述,预计将推动人工智能用于生成内容 (AIGC) 和世界模型的发展。一份与所有相关论文相关的精选列表可在 https://github.com/YingqingHe/Awesome-LLMs-meet-Multimodal-Generation 中找到。

关键词

引用

@article{arxiv.2405.19334,
  title  = {LLMs Meet Multimodal Generation and Editing: A Survey},
  author = {Yingqing He and Zhaoyang Liu and Jingye Chen and Zeyue Tian and Hongyu Liu and Xiaowei Chi and Runtao Liu and Ruibin Yuan and Yazhou Xing and Wenhai Wang and Jifeng Dai and Yong Zhang and Wei Xue and Qifeng Liu and Yike Guo and Qifeng Chen},
  journal= {arXiv preprint arXiv:2405.19334},
  year   = {2024}
}

备注

52 Pages with 16 Figures, 12 Tables, and 545 References. GitHub Repository at: https://github.com/YingqingHe/Awesome-LLMs-meet-Multimodal-Generation