基于优化潜在扩散的Muon加速注意力蒸馏实现边缘设备实时合成
计算机视觉与模式识别
2025-04-14 v1
摘要
近期在视觉合成中,扩散模型和注意力机制的结合实现了高保真艺术风格迁移和逼真的文本到图像生成。然而,在边缘设备上实现实时部署仍面临计算和内存限制的挑战。我们提出了Muon-AD,一个集成Muon优化器和注意力蒸馏的协同设计框架,用于实现实时边缘合成。通过消除梯度冲突的正交参数更新和动态修剪,Muon-AD相较于Stable Diffusion-TensorRT实现收敛速度提升3.2倍,同时保持合成质量(FID降低15%,SSIM提高4%)。我们的框架在Jetson Orin上峰值内存降至7GB,实现24FPS的实时生成,采用混合精度量化和课程学习。针对COCO-Stuff和ImageNet-Texture进行大量实验表明,Muon-AD在效率-质量之间实现了帕累托最优。我们展示了在分布式训练期间通信开销降低65%,并实现边缘GPU上的10秒/图像实时生成。这些突破为在资源受限环境中实现高质量视觉合成铺平了道路。
引用
@article{arxiv.2504.08451,
title = {Muon-Accelerated Attention Distillation for Real-Time Edge Synthesis via Optimized Latent Diffusion},
author = {Weiye Chen and Qingen Zhu and Qian Long},
journal= {arXiv preprint arXiv:2504.08451},
year = {2025}
}