各向异性是Transformer中自注意力的固有属性
计算与语言
2024-01-25 v2
摘要
表示退化问题是在基于Transformer的自监督学习方法中广泛观察到的一种现象。在自然语言处理中,它表现为各向异性,即隐藏表示的一种奇异特性,使得它们在角度距离(余弦相似度)上意外地彼此接近。最近的一些研究倾向于表明,各向异性是在长尾词元分布上优化交叉熵损失的结果。我们在本文中通过实验表明,在具有特定目标、不应直接受到相同后果影响的语言模型中,也可以观察到各向异性。我们还表明,各向异性问题扩展到在其他模态上训练的Transformer。我们的观察表明,各向异性实际上是基于Transformer的模型所固有的。
引用
@article{arxiv.2401.12143,
title = {Anisotropy Is Inherent to Self-Attention in Transformers},
author = {Nathan Godey and Éric de la Clergerie and Benoît Sagot},
journal= {arXiv preprint arXiv:2401.12143},
year = {2024}
}
备注
Proceedings of EACL 2024. A previous version of the paper, published as arXiv:2306.07656, was presented at ACL-SRW 2023 (non-archival)