长程 Transformer 的 NLP 任务有效性
计算与语言
2024-12-10 v2 机器学习
摘要
由于 O(N^2) 的时间与空间复杂度,Transformer 模型难以轻松扩展到长序列。这催生了旨在降低计算复杂度的 Transformer 变体,如 Longformer 和 Performer。尽管此类模型在理论上具有更高效率,但其在真实 NLP 任务上的有效性尚未得到充分研究。我们在 5 个困难 NLP 任务和 7 个数据集上基准测试了 7 种 Transformer 模型变体。我们设计实验以隔离预训练与超参数设置的影响,从而聚焦于其长程注意力能力。此外,我们提出多种方法来探究注意力行为,以揭示指标分数之外的模型细节。我们发现,长程 transformer 中改进的注意力在内容选择与查询引导解码上具有优势,但也带来此前未被认识的缺陷,例如对远距离 token 的注意力不足以及累积近似误差。
引用
@article{arxiv.2202.07856,
title = {The NLP Task Effectiveness of Long-Range Transformers},
author = {Guanghui Qin and Yukun Feng and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2202.07856},
year = {2024}
}
备注
Accepted to EACL 2023