梯度下降学习的过参数化 Transformer 分类器的收敛速率
机器学习
2024-06-21 v2 统计理论
机器学习
统计理论
摘要
人工智能领域最近最迷人的突破之一是 ChatGPT,这是一个可以模拟人类对话的聊天机器人。ChatGPT 是 GPT4 的一个实例,而 GPT4 是一种基于生成式预测 Transformer 的语言模型。因此,如果想从理论角度研究此类人工智能的强大程度,一种方法是考虑 Transformer 网络,并研究理论上可以用这些网络解决哪些问题。在此,不仅重要的是这些网络可以近似何种类型的模型,或者它们如何通过选择对具体数据集的最佳近似来泛化其学到的知识,同样重要的是基于具体数据集的此类 Transformer 网络优化效果如何。本文同时考虑了这三个不同方面,并展示了拟合观测数据的 Transformer 网络误分类概率的理论上限。为简化起见,我们在本背景下专注于 Transformer 编码器网络,该网络可用于定义涉及自然语言的分类问题中的估计量。
引用
@article{arxiv.2312.17007,
title = {On the rate of convergence of an over-parametrized Transformer classifier learned by gradient descent},
author = {Michael Kohler and Adam Krzyzak},
journal= {arXiv preprint arXiv:2312.17007},
year = {2024}
}