TRA:基于阈值相对注意力的更好长度泛化
机器学习
2025-10-07 v4 计算与语言
摘要
Transformer在长度泛化方面表现不佳,即使在基础任务上也常常下降。我们测试了两种自注意力机制的关键失效是否能解释这些限制:其一是无法完全消除无关信息;其二是即使键与查询的点积显著为负(即无关键),所学的位置偏置仍可能无意中提高此类信息的权重——当距离超出分布时,这一现象尤为危险。将这两种失效情况组合在一起,导致泛化困难的 compounding 效应。我们测试了通过以下两种缓解措施的组合是否能够缓解这些问题:a)选择性稀疏——完全从注意力softmax中移除无关键;b)情境化相对距离——仅考虑查询与重要键之间的距离。我们展示了在这两种缓解措施引入后,如何对仅使用解码器的Transformer模型的注意力机制进行重构,从而显著提升其泛化能力。
关键词
引用
@article{arxiv.2503.23174,
title = {TRA: Better Length Generalisation with Threshold Relative Attention},
author = {Mattia Opper and Roland Fernandez and Paul Smolensky and Jianfeng Gao},
journal= {arXiv preprint arXiv:2503.23174},
year = {2025}
}