Transformer:理论基础与应用
计算与语言
2025-05-06 v2 人工智能
摘要
Transformer是一种最初为自然语言处理开发的神经网络架构,现已成为解决广泛问题的基础工具,包括文本、音频、图像处理、强化学习以及其他涉及异构输入数据的任务。其标志性特征是自注意力机制,该机制允许模型动态地衡量输入序列的不同部分,是早期基于注意力方法的演进。本文为读者提供了理解近期Transformer模型研究所必需的背景知识,并介绍了其核心组件的数学和算法基础。文章还探讨了该架构的各种元素、可能的修改以及一些最相关的应用。本文以西班牙语撰写,旨在帮助使这些科学知识更容易为西班牙语社区所获取。
引用
@article{arxiv.2302.09327,
title = {Transformadores: Fundamentos teoricos y Aplicaciones},
author = {Jordi de la Torre},
journal= {arXiv preprint arXiv:2302.09327},
year = {2025}
}
备注
48 pages, in Spanish language, 24 figures, review