纯注意力 hardmax Transformer 中的聚类及其在情感分析中的作用
计算与语言
2026-05-14 v2 机器学习
动力系统
机器学习
摘要
Transformer 是极其成功的机器学习模型,其数学属性仍不为人知。本文严格描述了当层数趋于无穷时,具有 hardmax 自注意力和归一化子层的 Transformer 的行为。通过将此类 Transformer 视为描述欧几里得空间中点演化的离散时间动力系统,并借助基于超平面分离的自注意力机制几何解释,我们展示 Transformer 输入在渐进意义上收敛于由称为“领袖”(leaders)的特殊点决定的聚类平衡。我们随后利用这一理论理解来解决语言处理中的情感分析问题,构建一个完全可解释的 Transformer 模型,有效地通过将无意义词汇聚类围绕承载主要意义的领袖词汇,从而捕获“情境”。最后,我们概述了将 Transformer 的数学分析与实际实现之间的鸿沟的剩余挑战。
关键词
引用
@article{arxiv.2407.01602,
title = {Clustering in pure-attention hardmax transformers and its role in sentiment analysis},
author = {Albert Alcalde and Giovanni Fantuzzi and Enrique Zuazua},
journal= {arXiv preprint arXiv:2407.01602},
year = {2026}
}
备注
23 pages, 11 figures, 1 table. Funded by the European Union (Horizon Europe MSCA project ModConFlex, grant number 101073558). Accompanying code available at: https://github.com/DCN-FAU-AvH/clustering-hardmax-transformers