中文

通过排序实现的切片ReLU注意力:准线性情境表达性

机器学习 2026-02-05 v2

摘要

我们提出了切片ReLU注意力,这是一种与softmax及其近似替代方案在结构上不同的注意力机制。我们不对成对的点积应用非线性函数,而是对 key-query 差值的一维投影进行操作,并利用排序操作来获得准线性复杂度。这种构建方式产生一个可微分、非对称的核函数,可以通过排序过程在 O(n log(n)) 内计算,适用于非常长的上下文。除了计算优势之外,该模型保留了强大的理论表达能力:我们建立了两个情境表达结果,这两个结果先前已知适用于softmax注意力,表明切片ReLU注意力保留了执行非平凡序列到序列解缠任务的能力,并满足情境通用逼近属性。最后,我们在小到中等规模实验中说明了该核函数的潜在实际意义。

关键词

引用

@article{arxiv.2512.11411,
  title  = {Sliced ReLU attention: Quasi-linear contextual expressivity via sorting},
  author = {François-Xavier Vialard and Siwan Boufadène},
  journal= {arXiv preprint arXiv:2512.11411},
  year   = {2026}
}