中文

BERT的几何学

机器学习 2025-02-18 v1

摘要

Transformer 神经网络,特别是BERT(Bidirectional Encoder Representations from Transformers),在分类、文本摘要和问答等多种任务上已展现出显著性能。然而,其内部机制在数学上仍然模糊不清,凸显了对更强可解释性和可理解性的需求。在此方向上,本文研究了BERT的内部机制,从理论角度提出了对BERT注意力机制的新视角。分析涵盖了网络的局部和全局行为。在局部层面,我们提出了子空间选择方向性的概念,并对自注意力矩阵中涌现的模式进行了全面研究。此外,本文通过数据分析分布分析和全局统计度量(包括新颖的锥指数概念)来探索信息流中的语义内容。我们选取了一个使用RNA进行SARS-CoV-2变体分类的案例研究,获得了很高的准确率,以在实际应用中观察这些概念。本分析获得的见解有助于更深入地理解BERT的分类过程,为Transformer模型的未来架构改进和训练过程的进一步分析提供了潜在方向。

关键词

引用

@article{arxiv.2502.12033,
  title  = {The geometry of BERT},
  author = {Matteo Bonino and Giorgia Ghione and Giansalvo Cirrincione},
  journal= {arXiv preprint arXiv:2502.12033},
  year   = {2025}
}

备注

28 pages, 13 figures