注意力投影的非线性性:非线性查询之案
机器学习
2026-05-27 v3 人工智能
摘要
最近的代数分析表明,在解码器-only和编码器-only的变换器中,查询投影 可被设置为恒等而不会显著损失性能。这可能是因为注意力仅通过乘积 依赖于 ,允许将基准变换吸收到相邻层并通过网络传播。我们将 替换为形式为 的非线性残差,其中 为具有 参数的瓶颈MLP。恒等项将非线性锚定到已知良好先验上。在GPT-3小型模型实验中,我们的方法在基线上 consistently 获得改进(验证日志损失降低 ,每plexity降低 ),优于拥有 更多非嵌入参数的模型。这些结果激励在更大规模和跨模态上进行进一步调查。
引用
@article{arxiv.2603.13381,
title = {Beyond Linearity in Attention Projections: The Case for Nonlinear Queries},
author = {Marko Karbevski},
journal= {arXiv preprint arXiv:2603.13381},
year = {2026}
}
备注
Accepted at the ICLR 2026 GRaM workshop: https://openreview.net/forum?id=pwdnneFiNZ#discussion