面向高性能移动 NPU 的实图像噪声消除:知识蒸馏方法
摘要
尽管深度学习图像恢复已实现空前的图像保真度,但在移动 Neural Processing Units (NPUs) 上部署仍受制于算子不兼容和内存访问开销。我们提出一种面向移动 NPU 的硬件-算法协同设计方法,用于实现实际的图像去噪。该方法采用高容量教师网络监督一个专为利用现代移动 SoC 的分块内存架构而设计的轻量级学生网络。通过优先采用 NPU 原生原语——标准 3x3 卷积、ReLU 激活和最近邻上采样——并采用渐进式上下文扩展策略(最高达 1024x1024 裁剪),该模型在验证基准上实现 37.66 dB PSNR / 0.9278 SSIM,在 held-out 测试基准上实现 37.58 dB PSNR / 0.9098 SSIM(全分辨率 2432x3200),并在官方挑战规则下,以标准化的 Full HD(1088x1920)协议测得推理时延,在 MediaTek Dimensity 9500 上为 34.0 ms,在 Qualcomm Snapdragon 8 Elite NPU 上为 46.1 ms。我们进一步揭示了“推理逆转”效应,即严格遵循 NPU 兼容运算可实现专用 NPU 执行速度最高达集成移动 GPU 的 3.88 倍。该 196 万参数学生模型通过高 alpha 知识蒸馏(alpha=0.9)恢复了 99.8% 的教师恢复质量,参数减少 21.2 倍,将 PSNR 差距从 1.63 dB 缩小至仅 0.05 dB。这些结果表明硬件感知蒸馏是统一高保真去噪与实际部署在多样化移动 NPU 架构上之间的有效策略。所提出的轻量级学生模型(LiteDenoiseNet)及其训练统计数据已提供于 NN Dataset,链接为 https://github.com/ABrain-One/NN-Dataset。
引用
@article{arxiv.2605.03680,
title = {Real Image Denoising with Knowledge Distillation for High-Performance Mobile NPUs},
author = {Faraz Kayani and Sarmad Kayani and Asad Ahmed and Radu Timofte and Dmitry Ignatov},
journal= {arXiv preprint arXiv:2605.03680},
year = {2026}
}