中文

注意力机制实现零逼近误差

机器学习 2022-02-25 v1

摘要

深度学习模型已广泛应用于日常生活的各个方面。许多基于深度学习结构的变体模型取得了更优的性能。基于注意力的架构在深度学习结构中已几乎无处不在。特别是,transformer模型如今在图像分类任务中击败了卷积神经网络,成为使用最广泛的工具。然而,基于注意力的模型的理论性质鲜被考虑。在本工作中,我们表明,经过适当适配,具有固定数量transformer编码器块和自由参数的单头自注意力transformer能够无误差地生成输入的任意所需多项式。transformer编码器块的数量与目标多项式的次数相同。更令人振奋的是,我们发现该模型中的这些transformer编码器块无需训练。作为直接推论,我们表明具有递增自由参数数量的单头自注意力transformer是通用的。这些令人惊讶的理论结果清晰地解释了transformer模型的出色性能,并可能为实际应用中的未来改进提供启示。我们还提供了一些实验以验证我们的理论结果。

关键词

引用

@article{arxiv.2202.12166,
  title  = {Attention Enables Zero Approximation Error},
  author = {Zhiying Fang and Yidong Ouyang and Ding-Xuan Zhou and Guang Cheng},
  journal= {arXiv preprint arXiv:2202.12166},
  year   = {2022}
}