中文

HyperMLP:序列建模的集成视角

机器学习 2026-02-16 v1 人工智能 计算与语言 机器学习

摘要

自注意力常被视为概率查询-键查找,激发了维护归一化注意力得分和固定位置语义的设计。我们主张一种更简单且更统一的视角:自回归注意力头可被视为其权重从上下文历史中实例化的动态两层 MLP。从这个角度看,注意力得分形成不断增长的隐藏表示,标准MLP激活如ReLU或GLU自然地在上下文依赖的记忆池上实现输入条件化选择,而非概率分布。基于此表述,我们引入HyperMLP和HyperGLU,通过反向偏移(滞后)布局学习在特征空间和序列空间上的动态混合。我们对该结构的表达性和影响进行了理论表征,经验结果表明,HyperMLP/HyperGLU在参数预算匹配的情况下 consistently 优于强softmax注意力基线。

关键词

引用

@article{arxiv.2602.12601,
  title  = {HyperMLP: An Integrated Perspective for Sequence Modeling},
  author = {Jiecheng Lu and Shihao Yang},
  journal= {arXiv preprint arXiv:2602.12601},
  year   = {2026}
}