SSA:以更优评分函数提升性能
计算与语言
2026-05-12 v4
摘要
尽管 Transformer 模型展现出强大的上下文学习(ICL)能力,但在简单的分布偏移下,它们往往无法泛化。我们分析了这些失败案例,并确定注意力机制中的评分函数 Softmax 是一个促成因素。我们提出了一种新颖的注意力评分函数——缩放符号平均(SSA),以缓解这些失败。SSA 显著提升了我们在 ICL 任务上的性能,并在多个自然语言处理基准和语言探测任务上,在仅解码器和仅编码器架构中均优于使用 Softmax 的 Transformer 模型。
引用
@article{arxiv.2508.14685,
title = {SSA: Improving Performance With a Better Scoring Function},
author = {Omar Naim and Swarnadeep Bhar and Jérôme Bolte and Nicholas Asher},
journal= {arXiv preprint arXiv:2508.14685},
year = {2026}
}
备注
ACL 2026 Main Conference