多头注意力在上下文线性回归中的优越性
机器学习
2024-02-01 v1 人工智能
机器学习
摘要
我们对具有 softmax 注意力的 transformer 在上下文学习线性回归任务中的性能进行了理论分析。虽然现有文献主要关注单头/多头注意力 transformer 的收敛性,但我们的研究侧重于比较它们的性能。我们进行了精确的理论分析,以证明具有足够大嵌入维度的多头注意力比单头注意力表现更好。当上下文示例数量 D 增加时,使用单头/多头注意力的预测损失为 O(1/D),而多头注意力的预测损失具有更小的乘法常数。除了最简单的数据分布设置外,我们还考虑了更多场景,例如噪声标签、局部示例、相关特征和先验知识。我们观察到,通常情况下,多头注意力优于单头注意力。我们的结果验证了 transformer 架构中多头注意力设计的有效性。
引用
@article{arxiv.2401.17426,
title = {Superiority of Multi-Head Attention in In-Context Linear Regression},
author = {Yingqian Cui and Jie Ren and Pengfei He and Jiliang Tang and Yue Xing},
journal= {arXiv preprint arXiv:2401.17426},
year = {2024}
}