中文

RMT-KD:基于随机矩阵理论的因果知识蒸馏

机器学习 2026-02-09 v4

摘要

诸如 BERT 和 ResNet 等大型深度学习模型实现了最先进的性能,但由于其庞大的规模和计算需求,部署在边缘端成本高昂。我们提出 RMT-KD,一种利用随机矩阵理论(RMT)进行知识蒸馏以迭代缩减网络规模的压缩方法。RMT-KD 不采用剪枝或启发式秩选择,而是仅保留通过隐藏表示的谱性质所识别出的信息方向。基于 RMT 的因果缩减逐层应用并结合自蒸馏,以维持稳定性和准确率。在 GLUE 和 CIFAR-10 上,RMT-KD 实现了高达 80% 的参数缩减,准确率损失仅为 2%,推理速度提升 2.8 倍,功耗近乎减半。这些结果确立了 RMT-KD 作为一种具有数学基础的网络蒸馏方法。

关键词

引用

@article{arxiv.2509.15724,
  title  = {RMT-KD: Random Matrix Theoretic Causal Knowledge Distillation},
  author = {Davide Ettori and Nastaran Darabi and Sureshkumar Senthilkumar and Amit Ranjan Trivedi},
  journal= {arXiv preprint arXiv:2509.15724},
  year   = {2026}
}

备注

5 pages, submitted to ICASSP 2026, September 2025