中文

无聚类,无路由:Transformer 如何实际处理稀有 Token

计算与语言 2025-09-08 v1 人工智能

摘要

大型语言模型在稀有 token 预测方面存在困难,但驱动其特化性的机制仍不清楚。先前的工作识别出稀有 token 的专用“高原”神经元遵循独特的三阶段影响模式,但其功能组织结构尚属未知。我们通过在 GPT-2 XL 和 Pythia 模型中进行神经元影响分析、基于图的聚类和注意力头消融来研究这一问题。我们的研究结果表明: 稀有 token 的处理需要超出足以处理常见 token 的幂律区间的额外高原神经元,形成双重计算机制; 高原神经元在空间上是分布式的,而非形成模块化聚类; 注意力机制未表现出向专用神经元的偏好性路由。这些结果表明,稀有 token 的特化性是通过分布式、训练驱动的分化而非架构模块化产生的,在实现自适应容量分配的同时保留了上下文敏感的灵活性。

关键词

引用

@article{arxiv.2509.04479,
  title  = {No Clustering, No Routing: How Transformers Actually Process Rare Tokens},
  author = {Jing Liu},
  journal= {arXiv preprint arXiv:2509.04479},
  year   = {2025}
}