NanoSD:面向边缘设备实时图像复原的高效基础模型
计算机视觉与模式识别
2026-01-19 v2
摘要
Stable Diffusion 1.5 等潜扩散模型提供了对图像复原极具价值的强生成先验,但其完整流程在计算上仍过于繁重,难以部署于边缘设备。现有的轻量级变体主要压缩去噪 U-Net 或减少扩散轨迹,这破坏了底层的潜流形,并限制了其在单一任务之外的泛化能力。我们提出了 NanoSD,这是一族帕累托最优的扩散基础模型,通过对 U-Net 和 VAE 编码器-解码器联合应用网络手术、基于特征的生成式蒸馏和结构化架构缩放,从 Stable Diffusion 1.5 蒸馏而来。这种全流程协同设计保留了生成先验,同时产生的模型在精度-延迟-规模前沿上占据不同的工作点(例如,1.3 亿至 3.15 亿参数,在移动级 NPU 上实现低至 20 毫秒的实时推理)。我们表明,仅靠参数减少与硬件效率并不相关,并提供了分析,揭示了架构平衡、特征路由和潜空间保留如何共同塑造真实的设备端延迟。当用作即插即用的骨干网络时,NanoSD 在图像超分辨率、图像去模糊、人脸复原和单目深度估计等任务中实现了最先进的性能,在感知质量和实际可部署性方面均优于先前的轻量级扩散模型。NanoSD 建立了一个适用于边缘设备实时视觉生成与复原的通用扩散基础模型族。
引用
@article{arxiv.2601.09823,
title = {NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration},
author = {Subhajit Sanyal and Srinivas Soumitri Miriyala and Akshay Janardan Bankar and Manjunath Arveti and Sowmya Vajrala and Shreyas Pandith and Sravanth Kodavanti and Abhishek Ameta and Harshit and Amit Satish Unde},
journal= {arXiv preprint arXiv:2601.09823},
year = {2026}
}
备注
Submitted to CVPR 2026