ACDC: 使用扩散校正的自回归连贯多模态生成
机器学习
2024-10-08 v1 计算机视觉与模式识别
摘要
自回归模型(ARM)和扩散模型(DM)代表了生成建模中的两种主导范式,各自在不同领域表现出色:ARM在全局上下文建模和长序列生成方面,DM在生成高质量局部上下文方面,特别是对于连续数据如图像和短视频。然而,ARM通常会在长序列上遭受指数级误差累积,导致物理上不合理的结果,而DM则受限于其局部上下文生成能力。在这项工作中,我们引入了使用扩散校正的自回归连贯多模态生成(ACDC),这是一种零样本方法,在推理阶段结合了ARM和DM的优势,无需额外的微调。ACDC利用ARM进行全局上下文生成,并利用基于记忆的条件DM进行局部校正,通过纠正生成的多模态标记中的伪影来确保高质量输出。特别是,我们提出了一个基于大型语言模型(LLM)的记忆模块,该模块动态调整DM的条件文本,保留关键的全局上下文信息。我们在多模态任务(包括连贯的多帧故事生成和自回归视频生成)上的实验表明,ACDC有效缓解了误差累积,并显著提升了生成输出的质量,在保持对特定ARM和DM架构无关的同时实现了优越的性能。项目页面: https://acdc2025.github.io
引用
@article{arxiv.2410.04721,
title = {ACDC: Autoregressive Coherent Multimodal Generation using Diffusion Correction},
author = {Hyungjin Chung and Dohun Lee and Jong Chul Ye},
journal= {arXiv preprint arXiv:2410.04721},
year = {2024}
}
备注
25 pages, 10 figures. Project page: https://acdc2025.github.io/