中文

脉冲稀疏性未必转化为部署成本:基于 Jetson Orin Nano 的 VS-WNO 实验

机器学习 2026-04-21 v1 硬件体系结构 神经与进化计算

摘要

因事件驱动基质可原则上将稀疏活动转化为更低的时延与能耗,脉冲神经算子在神形器边缘计算中备受青睐。然而,这一优势在商品化边缘 GPU 软件堆栈上是否得以实现,尚无定论。我们在 8GB 的 Jetson Orin Nano 上,使用五个预训练的可变脉冲小波神经算子 (VS-WNO) 检查点和五个匹配的稠密小波神经算子 (WNO) 检查点进行测试,测试对象为 Darcy 矩形基准。在参考对齐路径上,VS-WNO 表现出显著的算法稀疏性,前四层脉冲率分别从 54.26% 下降至 18.15%。但在部署式请求路径上,此稀疏性并未降低部署成本:VS-WNO 的推理延迟为 59.6 ms,动态能耗为 228.0 mJ,而稠密 WNO 为 53.2 ms 和 180.7 mJ,同时还能实现略低的参考路径误差 (1.77% 与 1.81%)。Nsight Systems 显示,请求路径仍处于 launch 主导且稠密状态,而非稀疏感知:VS-WNO 中,cudaLaunchKernel 在延迟窗口内占据 CUDA API 时间的 81.6%,密集卷积核占 GPU 内核时间的 53.8%;稠密 WNO 亦呈相同模式。在此 Jetson 级 GPU 堆栈上,脉冲稀疏性虽可被测量,但因运行时未随脉冲活动降低而抑制密集计算,故未能降低部署成本。

关键词

引用

@article{arxiv.2604.17040,
  title  = {When Spike Sparsity Does Not Translate to Deployed Cost: VS-WNO on Jetson Orin Nano},
  author = {Jason Yoo and Shailesh Garg and Souvik Chakraborty and Syed Bahauddin Alam},
  journal= {arXiv preprint arXiv:2604.17040},
  year   = {2026}
}

备注

4 pages, 2 figures. Submitted to ICONS 2026 (under review)