通过通道级样本置换实现更好的多头注意力
机器学习
2024-10-16 v1 计算与语言
计算机视觉与模式识别
摘要
Transformer 在许多基础深度学习模型中占据核心地位,例如计算机视觉中的 ViT 以及自然语言处理中的 BERT 和 GPT,其有效性主要归因于其多头注意力(MHA)机制。本研究提出一种简单而新颖的通道级样本置换(CSP)算子,实现具有更少参数和更低复杂度的结构化 MHA。给定输入矩阵,CSP 对不同通道的样本按不同步幅进行循环位移,然后对每组样本进行排序。该算子等效于隐式实现作为置换矩阵的跨通道注意力图,从而实现线性复杂度并抑制了在表示数据时发生秩坍缩的风险。我们将一些具有代表性的模型的 MHA 替换为 CSP,并在包括图像分类和长序列分析在内的几个判别性任务中对 CSP-based 模型进行测试。实验表明,CSP-based 模型在参数更少且计算成本更低的情况下,相较于经典 Transformer 及其最先进的变体,实现了相当或更好的性能。代码已在 https://github.com/DaShenZi721/CSP 上提供。
引用
@article{arxiv.2410.10914,
title = {Towards Better Multi-head Attention via Channel-wise Sample Permutation},
author = {Shen Yuan and Hongteng Xu},
journal= {arXiv preprint arXiv:2410.10914},
year = {2024}
}
备注
18 pages, 4 figures