Softpick:无注意力沉底、无巨型激活的矩形 softmax
机器学习
2026-04-20 v4
摘要
我们提出 softpick,这是一种矩形且不归一化的 softmax 替代方案,用于 transformer 注意力机制中消除注意力沉底和巨型激活。我们的实验表明,softpick 在 340M 和 1.8B 参数模型中实现 0% 的沉底率。使用 softpick 的 transformer 产生的隐藏状态具有显著降低的峰度,并创建稀疏注意力图。采用 softpick 的量化模型在标准基准测试中超越 softmax,尤其在较低位精度时优势尤为显著。我们的分析和讨论表明,softpick 有望为量化、低精度训练、稀疏性优化、剪枝和可解释性带来新的可能性。我们的代码:https://github.com/zaydzuhri/softpick-attention
引用
@article{arxiv.2504.20966,
title = {Softpick: No Attention Sink, No Massive Activations with Rectified Softmax},
author = {Zayd M. K. Zuhri and Erland Hilman Fuadi and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2504.20966},
year = {2026}
}
备注
Updated to camera-ready version