中文

Sliceformer:在判别任务中将多头注意力简化为排序

机器学习 2023-10-30 v1

摘要

作为最流行的神经网络模块之一,Transformer在许多基础深度学习模型中扮演核心角色,例如计算机视觉中的ViT和自然语言处理中的BERT与GPT。Transformer的有效性常归功于其多头注意力(MHA)机制。在本研究中,我们讨论MHA的局限性,包括其“查询-键-值”架构带来的高计算复杂度,以及其softmax操作引起的数值问题。考虑到上述问题及注意力层近期的发展趋势,我们提出一种高效且有效的Transformer替代模型,称为Sliceformer。我们的Sliceformer用极简的“切片-排序”操作取代经典MHA机制,即把输入线性投影到潜空间并沿不同特征维度(或等价地称为通道)排序。对于每个特征维度,排序操作隐式生成具有稀疏、满秩和双随机结构的隐式注意力图。我们考虑切片-排序操作的不同实现并分析其对Sliceformer的影响。我们在Long-Range Arena基准、图像分类、文本分类和分子性质预测上测试Sliceformer,展示了其在计算复杂度上的优势及在判别任务中的普遍有效性。我们的Sliceformer以比Transformer及其变体更低的内存开销和更快的速度取得可比或更好的性能。此外,实验结果表明,应用我们的Sliceformer能在数据表示时经验性地抑制模式崩溃的风险。代码见\url{https://github.com/SDS-Lab/sliceformer}。

关键词

引用

@article{arxiv.2310.17683,
  title  = {Sliceformer: Make Multi-head Attention as Simple as Sorting in Discriminative Tasks},
  author = {Shen Yuan and Hongteng Xu},
  journal= {arXiv preprint arXiv:2310.17683},
  year   = {2023}
}