中文

面向变换器和神经网络的原始-对偶框架

机器学习 2024-06-21 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

自注意力机制是变换器在序列建模任务中取得巨大成功的关键因素,广泛应用于自然语言处理和计算机视觉等领域。类似地,神经网络层往往通过经验法则和经验方法进行设计。为为构建变换器中的注意力层提供原则化框架,我们展示自注意力对应于来自支持向量回归问题中导出的支持向量扩展,其原始形式呈现为神经网络层的结构。通过本框架,我们推导了实践中流行的注意力层,并提出两种新型注意力机制:1) 基于批量归一化层导出的批量归一化注意力(Attention-BN),2) 基于使用较少训练数据拟合 SVR 模型导出的带缩放头部注意力(Attention-SH)。我们在包括图像和时间序列分类等多种实际应用中,经验性地展示了 Attention-BN 和 Attention-SH 在减少注意力头冗余性、提高模型准确率以及提升模型效率方面的优势。

关键词

引用

@article{arxiv.2406.13781,
  title  = {A Primal-Dual Framework for Transformers and Neural Networks},
  author = {Tan M. Nguyen and Tam Nguyen and Nhat Ho and Andrea L. Bertozzi and Richard G. Baraniuk and Stanley J. Osher},
  journal= {arXiv preprint arXiv:2406.13781},
  year   = {2024}
}

备注

Accepted to ICLR 2023, 26 pages, 4 figures, 14 tables