中文

纯注意力 hardmax Transformer 中的聚类及其在情感分析中的作用

计算与语言 2026-05-14 v2 机器学习 动力系统 机器学习

摘要

Transformer 是极其成功的机器学习模型,其数学属性仍不为人知。本文严格描述了当层数趋于无穷时,具有 hardmax 自注意力和归一化子层的 Transformer 的行为。通过将此类 Transformer 视为描述欧几里得空间中点演化的离散时间动力系统,并借助基于超平面分离的自注意力机制几何解释,我们展示 Transformer 输入在渐进意义上收敛于由称为“领袖”(leaders)的特殊点决定的聚类平衡。我们随后利用这一理论理解来解决语言处理中的情感分析问题,构建一个完全可解释的 Transformer 模型,有效地通过将无意义词汇聚类围绕承载主要意义的领袖词汇,从而捕获“情境”。最后,我们概述了将 Transformer 的数学分析与实际实现之间的鸿沟的剩余挑战。

关键词

引用

@article{arxiv.2407.01602,
  title  = {Clustering in pure-attention hardmax transformers and its role in sentiment analysis},
  author = {Albert Alcalde and Giovanni Fantuzzi and Enrique Zuazua},
  journal= {arXiv preprint arXiv:2407.01602},
  year   = {2026}
}

备注

23 pages, 11 figures, 1 table. Funded by the European Union (Horizon Europe MSCA project ModConFlex, grant number 101073558). Accompanying code available at: https://github.com/DCN-FAU-AvH/clustering-hardmax-transformers