中文

保持流形的 Transformer 在短长程编码中表现有效

计算与语言 2023-10-24 v1 机器学习

摘要

基于多头自注意力的 Transformer 在不同学习任务中已展现出潜力。尽管这些模型在理解序列的短期和长期上下文方面表现出显著改进,Transformer 及其变体的编码器未能保持逐层的上下文信息。Transformer 通常将词元投影到稀疏流形上,且无法保持词元表示之间的数学等价性。在这项工作中,我们提出 TransJect,一种保证词元对之间逐层距离保持的理论界的编码器模型。我们提出一种点积注意力的简单替代方案以确保 Lipschitz 连续性。这使得 TransJect 能够学习单射映射,将词元表示变换到具有相似拓扑的不同流形上,并在后续层中保持每对词元之间的欧氏距离。在多个基准短序列和长序列分类任务上的评估分别显示出比 Transformer 变体最大 6.8% 和 5.9% 的提升。此外,TransJect 在语言建模任务上比 Transformer 表现出 79% 更好的性能。我们进一步从统计物理视角强调多头自注意力的缺陷。尽管多头自注意力被提出用于学习网络内不同的抽象层次,我们的实证分析表明不同的注意力头随机且无序地学习。相比之下,TransJect 采用混合专家进行正则化;这些专家更有序、更平衡,并从输入序列中学习不同的稀疏表示。TransJect 表现出极低的熵,并可高效扩展到更大深度。

关键词

引用

@article{arxiv.2310.14206,
  title  = {Manifold-Preserving Transformers are Effective for Short-Long Range Encoding},
  author = {Ayan Sengupta and Md Shad Akhtar and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2310.14206},
  year   = {2023}
}

备注

17 pages, 7 figures, 5 tables, Findings of the Association for Computational Linguistics: EMNLP2023