中文

Diffusion-RWKV:面向扩散模型的类 RWKV 架构扩展

计算机视觉与模式识别 2024-04-09 v1

摘要

Transformer 推动了计算机视觉和自然语言处理(NLP)领域的进步。然而,其巨大的计算复杂度限制了它们在长上下文任务中的应用,例如高分辨率图像生成。本文引入了一系列改编自 NLP 中 RWKV 模型的架构,并针对应用于图像生成任务的扩散模型进行了必要的修改,称为 Diffusion-RWKV。与基于 Transformer 的扩散模型类似,我们的模型旨在高效处理带有额外条件的序列化 patch 输入,同时具备良好的可扩展性,能够适应大规模参数和庞大数据集。其独特优势在于降低了空间聚合复杂度,使其在处理高分辨率图像时尤为出色,从而消除了对窗口化或组缓存操作的需求。在条件和无条件图像生成任务上的实验结果表明,Diffusion-RWKV 在 FID 和 IS 指标上达到了与现有基于 CNN 或 Transformer 的扩散模型相当或更优的性能,同时显著降低了总计算 FLOP 使用量。

关键词

引用

@article{arxiv.2404.04478,
  title  = {Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models},
  author = {Zhengcong Fei and Mingyuan Fan and Changqian Yu and Debang Li and Junshi Huang},
  journal= {arXiv preprint arXiv:2404.04478},
  year   = {2024}
}