中文

线性自注意力的扩展用于类注意学习

机器学习 2025-04-01 v1

摘要

类注意学习是变压器的一个显著特性,近期研究聚焦于此。注意力机制是变压器中的关键组件,其中注意力矩阵编码了句子中单词之间的关系,并用作句子中单词的权重。该机制对于捕获语言表示方面有效。然而,是否普遍适用于一般任务中的类注意学习值得质疑,因为自注意力实现的计算在矩阵乘法方面相对受限。事实上,我们可能需要在考虑算法计算实现的合理输入形式设计时,引入适当的输入形式。在本文中,针对线性自注意力,我们通过引入用于输入的偏置矩阵来扩展它。尽管扩展简单,但扩展后的线性自注意力可以输出任意常数矩阵、输入矩阵以及输入中两或三个矩阵的乘积。请注意,第二属性意味着它可以作为跳跃连接。因此,可以通过连接扩展后的线性自注意力组件来实现灵活的矩阵操作。作为使用扩展后线性自注意力的示例实现,我们展示了在合理输入形式下的批量型梯度下降 Ridge 回归的启发式构建。

关键词

引用

@article{arxiv.2503.23814,
  title  = {An extension of linear self-attention for in-context learning},
  author = {Katsuyuki Hagiwara},
  journal= {arXiv preprint arXiv:2503.23814},
  year   = {2025}
}