中文

从ReLU到Transformer近似

机器学习 2026-04-29 v1 人工智能 机器学习

摘要

我们提供了将ReLU近似结果系统化转化为softmax注意力机制的配方。该配方涵盖许多常见的近似目标。重要的是,它产生针对特定目标的、经济的资源界限,超越普遍的逼近陈述。我们在乘法、倒数计算和min/max基本运算上展示了该配方。这些结果为分析softmax transformer模型提供了新的分析工具。

关键词

引用

@article{arxiv.2604.24878,
  title  = {Transformer Approximations from ReLUs},
  author = {Jerry Yao-Chieh Hu and Mingcheng Lu and Yi-Chen Lee and Han Liu},
  journal= {arXiv preprint arXiv:2604.24878},
  year   = {2026}
}