ACNPU:一款具有解耦非对称卷积的 4.75TOPS/W 1080P@30FPS 超分辨率加速器
图像与视频处理
2025-03-25 v1 硬件体系结构
计算机视觉与模式识别
摘要
深度学习驱动的图像超分辨率(SR)优于传统技术,但也面临高复杂度和高内存带宽的挑战。这一挑战导致许多加速器选择更简单、更浅的模型(如 FSRCNN),为实时需求牺牲性能,尤其对于资源受限的边缘设备。本文提出一款高能效 SR 加速器 ACNPU 以应对该挑战。ACNPU 采用 27 层模型将图像质量提升 0.34dB,但相比 FSRCNN 复杂度降低 36%,同时保持相近模型规模,其采用解耦非对称卷积与分流旁路结构。该硬件友好的 17K 参数模型支持整体模型融合而非局部层融合,从而消除中间特征图的外部 DRAM 访问。通过输入静止数据流与并行层执行进一步降低片上内存带宽以减小功耗。硬件规则且易控,通过具有可重构输入和统一数据流的处理单元(PE)簇支持不同层。该设计采用 40 nm CMOS 工艺实现,消耗 2333 K 门数与 198KB SRAM。ACNPU 在 x2 与 x4 尺度全高清生成中分别达到 31.7 FPS 与 124.4 FPS,能效达 4.75 TOPS/W。
引用
@article{arxiv.2308.15807,
title = {ACNPU: A 4.75TOPS/W 1080P@30FPS Super Resolution Accelerator with Decoupled Asymmetric Convolution},
author = {Tun-Hao Yang and Tian-Sheuan Chang},
journal= {arXiv preprint arXiv:2308.15807},
year = {2025}
}
备注
9 pages, 14 figures