中文

行进的词语:Transformer的几何诠释

计算与语言 2023-09-20 v2 人工智能 机器学习

摘要

Transformer已显著推进自然语言处理领域,但理解其内部机制仍具挑战。本文中,我们引入一种新颖的几何视角,阐明了Transformer操作的内部机制。我们的主要贡献是阐释层归一化如何将潜在特征约束于超球面,进而使注意力能在该表面上塑造词语的语义表示。这一几何视角无缝连通了迭代精炼与上下文嵌入等已知性质。我们通过探测一个1.24亿参数的预训练GPT-2模型验证了我们的见解。我们的发现揭示了早期层中清晰的查询-键注意力模式,并建立在先前关于深层注意力头具有主体特定性的观察之上。借助这些几何洞察,我们呈现了对Transformer的直观理解,将其描绘为在超球面上建模词粒子轨迹的过程。

关键词

引用

@article{arxiv.2309.07315,
  title  = {Traveling Words: A Geometric Interpretation of Transformers},
  author = {Raul Molina},
  journal= {arXiv preprint arXiv:2309.07315},
  year   = {2023}
}