生成式自回归扩散变换器
计算机视觉与模式识别
2025-10-09 v5 人工智能
摘要
本文提出 GPDiT,一种生成式预训练自回归扩散变换器,在连续潜在空间中统一扩散和自回归建模技术,用于长程视频合成。不同于预测离散标记,GPDiT 通过扩散损失自回归预测未来潜在帧,从而实现对运动动力学和帧间语义一致性的自然建模。这种连续自回归框架不仅提升了生成质量,还赋予模型表示能力。此外,我们引入轻量级因果注意力变体和无参数旋转式时间条件机制,提高了训练和推理效率。大量实验表明,GPDiT 在视频生成质量、视频表示能力和少样本学习任务方面均表现出色,凸显其作为连续空间视频建模有效框架的潜力。
引用
@article{arxiv.2505.07344,
title = {Generative Pre-trained Autoregressive Diffusion Transformer},
author = {Yuan Zhang and Jiacheng Jiang and Guoqing Ma and Zhiying Lu and Haoyang Huang and Jianlong Yuan and Nan Duan and Daxin Jiang},
journal= {arXiv preprint arXiv:2505.07344},
year = {2025}
}