中文

Softpick:无注意力沉底、无巨型激活的矩形 softmax

机器学习 2026-04-20 v4

摘要

我们提出 softpick,这是一种矩形且不归一化的 softmax 替代方案,用于 transformer 注意力机制中消除注意力沉底和巨型激活。我们的实验表明,softpick 在 340M 和 1.8B 参数模型中实现 0% 的沉底率。使用 softpick 的 transformer 产生的隐藏状态具有显著降低的峰度,并创建稀疏注意力图。采用 softpick 的量化模型在标准基准测试中超越 softmax,尤其在较低位精度时优势尤为显著。我们的分析和讨论表明,softpick 有望为量化、低精度训练、稀疏性优化、剪枝和可解释性带来新的可能性。我们的代码:https://github.com/zaydzuhri/softpick-attention

关键词

引用

@article{arxiv.2504.20966,
  title  = {Softpick: No Attention Sink, No Massive Activations with Rectified Softmax},
  author = {Zayd M. K. Zuhri and Erland Hilman Fuadi and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2504.20966},
  year   = {2026}
}

备注

Updated to camera-ready version