超越大语言模型的生成式 AI:多模态生成的系统影响
摘要
随着大规模生成式 AI 模型的发展从文本(1D)生成扩展到图像(2D)和视频(3D)生成,处理时空信息对质量、性能和效率提出了独特的挑战。我们提出了首项致力于理解多模态文本到图像(TTI)和文本到视频(TTV)生成模型这一新系统设计空间的工作。当前的模型架构设计分为两类:基于扩散(Diffusion)的模型和基于 Transformer 的模型。我们对一套八个具有代表性的 TTI/TTV 模型进行的系统性能表征表明,在应用 Flash Attention 等最先进优化技术后,卷积操作占基于扩散的 TTI 模型执行时间的 44%,而线性层消耗了基于 Transformer 的 TTI 模型高达 49% 的执行时间。我们还观察到,基于扩散的 TTI 模型类似于大语言模型(LLM)推理的 Prefill 阶段,从 Flash Attention 获得的加速比(1.1-2.5 倍)高于类似于 Decode 阶段的基于 Transformer 的 TTI 模型。由于为大语言模型设计的优化方案不能直接映射到 TTI/TTV 模型上,我们必须对这些工作负载进行彻底的表征,以获得新优化机会的见解。在此过程中,我们定义了 TTI/TTV 模型上下文中的序列长度,并观察到扩散模型推理中的序列长度变化可达 4 倍。我们还观察到 TTV 工作负载的时间维度带来了独特的系统瓶颈,其中时间注意力(Temporal Attention)占总注意力时间的 60% 以上。总体而言,我们深入的系统性能表征是设计用于新兴 TTI/TTV 工作负载的高效且可部署系统的关键第一步。
引用
@article{arxiv.2312.14385,
title = {Generative AI Beyond LLMs: System Implications of Multi-Modal Generation},
author = {Alicia Golden and Samuel Hsia and Fei Sun and Bilge Acun and Basil Hosmer and Yejin Lee and Zachary DeVito and Jeff Johnson and Gu-Yeon Wei and David Brooks and Carole-Jean Wu},
journal= {arXiv preprint arXiv:2312.14385},
year = {2024}
}
备注
Published at 2024 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)