自注意力为何天然适用于序列到序列问题?一个基于对称性的视角
机器学习
2022-10-14 v1 计算与语言
摘要
在本文中,我们从对称性的视角表明,类似于自注意力的结构对于学习许多序列到序列问题是自然的。受语言处理应用的启发,我们研究带知识的 seq2seq 函数的正交等变性,这些函数是取两个输入——一个输入序列与一个“知识”——并输出另一个序列的函数。知识由一组与输入序列处于相同嵌入空间中的向量组成,包含用于处理输入序列的语言的信息。我们表明嵌入空间中的正交等变性对于带知识的 seq2seq 函数是自然的,并且在此等变性下该函数必须取接近于自注意力的形式。这表明类似于自注意力的网络结构是用于表示许多 seq2seq 问题目标函数的正确结构。若考虑“有限信息原理”,或对输入序列的元素成立置换等变性,则该表示可进一步精炼。
引用
@article{arxiv.2210.06741,
title = {Why self-attention is Natural for Sequence-to-Sequence Problems? A Perspective from Symmetries},
author = {Chao Ma and Lexing Ying},
journal= {arXiv preprint arXiv:2210.06741},
year = {2022}
}