缓解小规模注意力局部化:通过一步信念传播的自注意力精炼
计算与语言
2025-09-10 v1 人工智能
摘要
基于Transformer的自注意力机制是现代语言模型的核心,但它常常遭受局部化问题,即注意力坍缩到有限的标记子集上,无法捕捉长距离依赖。为解决此问题,我们提出了自注意力一步信念传播(SAOBP),这是一个通过信念传播过程注入多跳关系的精炼框架。为了解释和量化这些交互,我们引入了全局标记依赖(GTD),它捕捉了注意力图中多跳连接的相对贡献。实证结果表明,SAOBP有助于防止更深层中的熵坍缩,并自适应地将GTD维持在任务适宜的水平,从而支持模型性能的提升。重要的是,我们在小规模模型中观察到了具有竞争力的增益,突显了其在资源受限场景下提高推理质量的潜力。
引用
@article{arxiv.2509.07324,
title = {Mitigating Attention Localization in Small Scale: Self-Attention Refinement via One-step Belief Propagation},
author = {Nakyung Lee and Yeongoon Kim and Minhae Oh and Suhwan Kim and Jin Woo Koo and Hyewon Jo and Jungwoo Lee},
journal= {arXiv preprint arXiv:2509.07324},
year = {2025}
}
备注
Accepted at EMNLP 2025