中文

缓解小规模注意力局部化:通过一步信念传播的自注意力精炼

计算与语言 2025-09-10 v1 人工智能

摘要

基于Transformer的自注意力机制是现代语言模型的核心,但它常常遭受局部化问题,即注意力坍缩到有限的标记子集上,无法捕捉长距离依赖。为解决此问题,我们提出了自注意力一步信念传播(SAOBP),这是一个通过信念传播过程注入多跳关系的精炼框架。为了解释和量化这些交互,我们引入了全局标记依赖(GTD),它捕捉了注意力图中多跳连接的相对贡献。实证结果表明,SAOBP有助于防止更深层中的熵坍缩,并自适应地将GTD维持在任务适宜的水平,从而支持模型性能的提升。重要的是,我们在小规模模型中观察到了具有竞争力的增益,突显了其在资源受限场景下提高推理质量的潜力。

关键词

引用

@article{arxiv.2509.07324,
  title  = {Mitigating Attention Localization in Small Scale: Self-Attention Refinement via One-step Belief Propagation},
  author = {Nakyung Lee and Yeongoon Kim and Minhae Oh and Suhwan Kim and Jin Woo Koo and Hyewon Jo and Jungwoo Lee},
  journal= {arXiv preprint arXiv:2509.07324},
  year   = {2025}
}

备注

Accepted at EMNLP 2025