自注意力需要何种稠密图?
机器学习
2022-10-13 v5 人工智能
计算与语言
摘要
Transformer 已在各类任务中取得进展,但受限于二次的计算与内存复杂度。近期工作提出稀疏 Transformer,在稀疏图上进行注意力以降低复杂度并保持强劲性能。尽管有效,但对于表现良好所需图的稠密程度这一关键部分尚未充分探索。本文提出归一化信息载荷(NIP),一种衡量图上信息传输的图评分函数,为性能与复杂度之间的权衡提供分析工具。在该理论分析指导下,我们提出超立方体 Transformer,一种在超立方体中建模词元交互的稀疏 Transformer,在序列长度 下以 复杂度展现出与原始 Transformer 相当甚至更优的结果。在需要不同序列长度任务上的实验验证了我们图函数的良好性。
引用
@article{arxiv.2205.14014,
title = {What Dense Graph Do You Need for Self-Attention?},
author = {Yuxin Wang and Chu-Tak Lee and Qipeng Guo and Zhangyue Yin and Yunhua Zhou and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2205.14014},
year = {2022}
}
备注
Accepted by ICML 2022. Code is available at https://github.com/yxzwang/Normalized-Information-Payload