行进的词语:Transformer的几何诠释
计算与语言
2023-09-20 v2 人工智能
机器学习
摘要
Transformer已显著推进自然语言处理领域,但理解其内部机制仍具挑战。本文中,我们引入一种新颖的几何视角,阐明了Transformer操作的内部机制。我们的主要贡献是阐释层归一化如何将潜在特征约束于超球面,进而使注意力能在该表面上塑造词语的语义表示。这一几何视角无缝连通了迭代精炼与上下文嵌入等已知性质。我们通过探测一个1.24亿参数的预训练GPT-2模型验证了我们的见解。我们的发现揭示了早期层中清晰的查询-键注意力模式,并建立在先前关于深层注意力头具有主体特定性的观察之上。借助这些几何洞察,我们呈现了对Transformer的直观理解,将其描绘为在超球面上建模词粒子轨迹的过程。
引用
@article{arxiv.2309.07315,
title = {Traveling Words: A Geometric Interpretation of Transformers},
author = {Raul Molina},
journal= {arXiv preprint arXiv:2309.07315},
year = {2023}
}