Transformer 架构的通用性;多少注意力就足够了?
机器学习
2025-12-23 v1
摘要
Transformer 在诸多 AI 领域至关重要,例如大型语言模型、计算机视觉和强化学习。这一显著性源于该架构相较于替代方案在可扩展性和通用性方面的 perceived 优势。本 work 考察了 Transformer 可扩展性的问题,回顾了近期进展,包括结构最小化和逼近率等架构细化,以及旨在 inform 理论和实践理解的最新进展。我们的目标是阐明当前关于 Transformer 表示力的已知情况,区分稳健的保证与脆弱的保证,并确定未来理论研究的关键方向。
关键词
引用
@article{arxiv.2512.18445,
title = {On the Universality of Transformer Architectures; How Much Attention Is Enough?},
author = {Amirreza Abbasi and Mohsen Hooshmand},
journal= {arXiv preprint arXiv:2512.18445},
year = {2025}
}