跳过层注意力:桥接Transformer中的抽象与详细依赖关系
计算与语言
2024-06-18 v1
摘要
Transformer架构通过有效管理长程依赖关系,显著推动了深度学习,特别是在自然语言处理领域。然而,随着对理解复杂关系需求的增长,细化Transformer架构变得至关重要。本文引入跳过层注意力 (SLA) 以增强Transformer模型,使其能够直接注意力于非相邻层之间的关系。该方法提高了模型捕获高层抽象特征与低层细节之间依赖关系的能力。通过促进这些不同特征水平之间的直接注意力,我们的方法克服了当前Transformer的局限性——后者常依赖次优的层内注意力。我们的实现通过允许给定层的查询与来自当前层和前一层的键和值的直接交互,从而在不增加额外计算负担的情况下扩展了Transformer的功能,增强了多头注意力的多样性。广泛的实验表明,我们的增强Transformer模型在语言建模任务中实现了卓越的性能,凸显了我们跳过层注意力机制的有效性。
关键词
引用
@article{arxiv.2406.11274,
title = {Skip-Layer Attention: Bridging Abstract and Detailed Dependencies in Transformers},
author = {Qian Chen and Wen Wang and Qinglin Zhang and Siqi Zheng and Shiliang Zhang and Chong Deng and Hai Yu and Jiaqing Liu and Yukun Ma and Chong Zhang},
journal= {arXiv preprint arXiv:2406.11274},
year = {2024}
}
备注
7 pages, 1 figure