多层注意力是示范有效性的放大器
计算与语言
2025-08-04 v1 机器学习
摘要
已有大量研究探讨了上下文学习(ICL)有效性的内在机理,以启发相关方法的设计。然而,现有工作普遍假设 ICL 中所提供的示范是有效的,但许多研究表明并非所有示范都有效,无法在 ICL 过程中带来任何性能提升。因此,本文对示范失效的原因展开研究。我们的分析基于梯度流与线性自注意力模型。通过将梯度流置零,我们推导出:若某示范所含信息已被模型习得或与用户查询无关,则该示范将失效。此外,我们证明在多层模型中,示范间的有效性差异会随层数增加而被放大,致使模型更加聚焦于有效的示范。鉴于当前示范选择方法主要关注与用户查询的相关性,而忽略了模型已习得的信息,我们提出一种名为 GradS 的新方法,利用梯度流进行示范选择。我们以示范相对于给定用户查询的梯度流幅值作为判据,从而保证所选示范的有效性。我们在四个主流大语言模型(LLM)和五个主流数据集上验证了推导及 GradS。实验结果证实,示范间的有效性差异随模型层数增加而被放大,印证了我们的推导。此外,GradS 相对于最强基线平均取得了 的相对提升,证明了其有效性。
引用
@article{arxiv.2508.00385,
title = {Multi-Layer Attention is the Amplifier of Demonstration Effectiveness},
author = {Dingzirui Wang and Xuangliang Zhang and Keyan Xu and Qingfu Zhu and Wanxiang Che and Yang Deng},
journal= {arXiv preprint arXiv:2508.00385},
year = {2025}
}