中文

SHARe-KAN:面向缓存驻留 KAN 推理的后训练向量量化

机器学习 2026-04-16 v2 分布式、并行与集群计算

摘要

预训练的视觉Kolmogorov-Arnold Networks(KANs)在每条边上存储稠密B样条网格,使预测头参数相较于相当于MLP的模型数目增加超过140倍,导致在边缘加速器上推理进入内存受限状态。标准幅度剪枝对这些预训练模型效果不佳:零shot稀疏性会导致准确率崩溃,恢复准确率需要迭代微调循环,而这在部署设置中是不可行的。我们提出SHARe-KAN,一款后训练编译器,通过层共享码本的Gain-Shape-Bias分解压缩样条系数,配合LUTHAM执行时序,将码本映射到on-chip L2。在ResNet-50主干网络的PASCAL VOC检测上,SHARe-KAN Int8相较于Dense KAN基线实现了9.3倍存储压缩(6.32 MB vs. 58.67 MB预测头),仅以2.0点In-domain准确率代价(80.22% vs. 82.22% mAP),且无需重新训练。Zero-shot迁移到COCO保留了88.9%的Dense KAN mAP;其中大部分差距来自VQ聚类步骤本身,从FP32量化到Int8仅造成1.3个保留点。该方法的价值随规模而增:在50个任务头下,Dense KAN预测头存储达2.9 GB,而SHARe-KAN Int8仅需211 MB,压缩率达13.9倍,将多专家KAN部署纳入当代边缘硅片的内存预算之内。

关键词

引用

@article{arxiv.2512.15742,
  title  = {SHARe-KAN: Post-Training Vector Quantization for Cache-Resident KAN Inference},
  author = {Jeff Smith},
  journal= {arXiv preprint arXiv:2512.15742},
  year   = {2026}
}