中文

SSA:以更优评分函数提升性能

计算与语言 2026-05-12 v4

摘要

尽管 Transformer 模型展现出强大的上下文学习(ICL)能力,但在简单的分布偏移下,它们往往无法泛化。我们分析了这些失败案例,并确定注意力机制中的评分函数 Softmax 是一个促成因素。我们提出了一种新颖的注意力评分函数——缩放符号平均(SSA),以缓解这些失败。SSA 显著提升了我们在 ICL 任务上的性能,并在多个自然语言处理基准和语言探测任务上,在仅解码器和仅编码器架构中均优于使用 Softmax 的 Transformer 模型。

关键词

引用

@article{arxiv.2508.14685,
  title  = {SSA: Improving Performance With a Better Scoring Function},
  author = {Omar Naim and Swarnadeep Bhar and Jérôme Bolte and Nicholas Asher},
  journal= {arXiv preprint arXiv:2508.14685},
  year   = {2026}
}

备注

ACL 2026 Main Conference