作为连续词专家混合的双向注意力
计算与语言
2023-12-12 v2 机器学习
机器学习
摘要
双向注意力 由带位置编码的自注意力与掩码语言模型(MLM)目标组成 已成为现代大语言模型(LLMs)的关键组件。尽管其取得了经验性成功,鲜有研究考察其统计基础:双向注意力隐式拟合的是何种统计模型?它与其非注意力前辈的区别何在?我们在本文中探讨这些问题。关键观察是,对单层单头双向注意力进行重参数化后拟合,等价于拟合带有混合专家(MoE)权重的连续词袋(CBOW)模型。进一步,多头多层的双向注意力分别等价于堆叠的 MoE 与 MoE 的混合。这一统计视角揭示了双向注意力中 MoE 的独特用法,与其在处理异质数据上的实际有效性相符。若我们将句子中的每个词位置视为表格特征,它也提示了对类别型表格数据的直接扩展。在经验研究中,我们发现该扩展在分布外(OOD)泛化上优于现有的 transformer 表格扩展。最后,双向注意力的这一统计视角使我们能够从理论上刻画其词嵌入中何时存在线性词类比。这些分析表明,与非注意力前辈相比,双向注意力可能需要强得多的假设才能展现出线性词类比。
引用
@article{arxiv.2307.04057,
title = {Bidirectional Attention as a Mixture of Continuous Word Experts},
author = {Kevin Christian Wibisono and Yixin Wang},
journal= {arXiv preprint arXiv:2307.04057},
year = {2023}
}
备注
32 pages. Published in UAI 2023