中文

无黑盒的模加法:压缩计算数值积分的MLP的解释

机器学习 2024-12-06 v1 人工智能

摘要

机制可解释性的目标是发现模型实现的更简单、低秩的算法。虽然我们可以将激活压缩成特征,但压缩非线性特征映射(如 MLP 层)是一个开放问题。在这项工作中,我们提出了第一个严格压缩非线性特征映射的案例研究,这是压缩小型 Transformer 模型的主要渐近瓶颈。我们在经典的模加法模型设置下工作,并针对 ReLU MLP 的行为,以电路参数数量的线性时间,得到一个非平凡的上界。为了分析地研究 ReLU MLP,我们使用了无限宽度视角,它将激活后的矩阵乘法转化为近似积分。我们发现了实现“披萨”算法的单层 Transformer 中 MLP 层的一个新颖解释:MLP 可以被理解为评估一个求积方案,其中每个神经元计算一个三角积分恒等式曲线下矩形的面积。我们的代码可在 https://tinyurl.com/mod-add-integration 获取。

关键词

引用

@article{arxiv.2412.03773,
  title  = {Modular addition without black-boxes: Compressing explanations of MLPs that compute numerical integration},
  author = {Chun Hei Yip and Rajashree Agrawal and Lawrence Chan and Jason Gross},
  journal= {arXiv preprint arXiv:2412.03773},
  year   = {2024}
}