中文

注意力投影的非线性性:非线性查询之案

机器学习 2026-05-27 v3 人工智能

摘要

最近的代数分析表明,在解码器-only和编码器-only的变换器中,查询投影 WQW_Q 可被设置为恒等而不会显著损失性能。这可能是因为注意力仅通过乘积 XWQ,XWK,XWVXW_Q, XW_K, XW_V 依赖于 XX,允许将基准变换吸收到相邻层并通过网络传播。我们将 WQRd×dW_Q \in \R^{d \times d} 替换为形式为 Q(X)=X+fθ(X)Q(X) = X + f_\theta(X) 的非线性残差,其中 fθf_\theta 为具有 d2+O(d)d^2 + O(d) 参数的瓶颈MLP。恒等项将非线性锚定到已知良好先验上。在GPT-3小型模型实验中,我们的方法在基线上 consistently 获得改进(验证日志损失降低 2.40%2.40\%,每plexity降低 6.81%6.81\%),优于拥有 12.5%12.5\% 更多非嵌入参数的模型。这些结果激励在更大规模和跨模态上进行进一步调查。

关键词

引用

@article{arxiv.2603.13381,
  title  = {Beyond Linearity in Attention Projections: The Case for Nonlinear Queries},
  author = {Marko Karbevski},
  journal= {arXiv preprint arXiv:2603.13381},
  year   = {2026}
}

备注

Accepted at the ICLR 2026 GRaM workshop: https://openreview.net/forum?id=pwdnneFiNZ#discussion