从ReLU到Transformer近似
机器学习
2026-04-29 v1 人工智能
机器学习
摘要
我们提供了将ReLU近似结果系统化转化为softmax注意力机制的配方。该配方涵盖许多常见的近似目标。重要的是,它产生针对特定目标的、经济的资源界限,超越普遍的逼近陈述。我们在乘法、倒数计算和min/max基本运算上展示了该配方。这些结果为分析softmax transformer模型提供了新的分析工具。
引用
@article{arxiv.2604.24878,
title = {Transformer Approximations from ReLUs},
author = {Jerry Yao-Chieh Hu and Mingcheng Lu and Yi-Chen Lee and Han Liu},
journal= {arXiv preprint arXiv:2604.24878},
year = {2026}
}