中文

筛选即可

机器学习 2026-05-08 v3 人工智能 计算与语言

摘要

标准软最大注意力的一个核心局限在于其无法提供独立可解释的查询-键相关性度量:注意力得分是无界的,而注意力权重仅相对于竞争的键进行定义。因此,无法显式地排除无关的键,即使没有任何键真正相关,也会分配一些注意力。我们引入了一种称为筛选的机制,构建了名为Multiscreen的语言模型架构,使查询-键相关性具有绝对意义。与在所有键之间重新分配注意力不同,筛选计算受限的查询-键相似度,并应用显式阈值,丢弃无关键并在无全局竞争的情况下聚合剩余键。通过实验,Multiscreen在约30%更少的参数下即可实现与Transformer基线相当的验证损失,并在显著更大的学习率下保持稳定。在训练上下文之外的长程语境中保持稳定的困惑度,并在上下文长度增加时表现出很小的检索性能下降。最后,Multiscreen在长上下文长度下的完整前向传递延迟更低。

关键词

引用

@article{arxiv.2604.01178,
  title  = {Screening Is Enough},
  author = {Ken M. Nakanishi},
  journal= {arXiv preprint arXiv:2604.01178},
  year   = {2026}
}

备注

36 pages, 27 figures. Revised version with retuned Transformer baselines, additional experiments, ablations, and appendix analyses