中文

面向大规模系统的 Kolmogorov-Arnold 网络(KAN)硬件加速

硬件体系结构 2025-09-09 v1

摘要

近期的研究引入了 Kolmogorov-Arnold 网络(KAN),这是一种新型架构,能够通过采用可训练系数的分段函数(B-样条函数)来复制传统深度神经网络(DNN)的功能,同时显著降低参数数量。然而,KAN 架构中包含的 B-样条函数组件带来了独特的硬件加速复杂性。虽然 B-样条函数评估可以通过查找表(LUT)实现,以直接编码功能映射从而最小化计算开销,但此类方法仍需大量电路基础设施,包括 LUT、复用器、解码器及相关组件。本文提出了一种面向 KAN 加速的算法-硬件协同设计方法。在算法层面,包括 Alignment-Symmetry 和 PowerGap KAN 硬件感知量化、KAN 稀疏感知映射策略;在电路层面,包括 N:1 时间调制动态电压输入发生器配合模拟计算存储(ACIM)电路。本文在大规模 KAN 网络上进行评估,以验证所提方法。针对 TSMC 22nm RRAM-ACIM 原型芯片测得的统计数据,对包括部分求和偏离工艺变异在内的非理想因素进行了评估。利用在 22nm 工艺节点上优化后的 KAN 超参数结合电路优化,尽管本文中大规模任务的参数数量较先前工作中的小规模任务增加了 50 万至 80 万,但面积开销仅增加 2.8 万至 4.1 万,功耗提升仅为 51 倍至 94 倍,同时准确率退化保持在 0.11% 至 0.23% 之间,充分展示了所提架构的可扩展性。

关键词

引用

@article{arxiv.2509.05937,
  title  = {Hardware Acceleration of Kolmogorov-Arnold Network (KAN) in Large-Scale Systems},
  author = {Wei-Hsing Huang and Jianwei Jia and Yuyao Kong and Faaiq Waqar and Tai-Hao Wen and Meng-Fan Chang and Shimeng Yu},
  journal= {arXiv preprint arXiv:2509.05937},
  year   = {2025}
}