简单局部注意力在长上下文任务中仍具竞争力
计算与语言
2022-05-05 v2
摘要
许多 NLP 任务需要处理超出预训练模型长度限制的长上下文。为将这些模型扩展至更长文本序列,已有许多高效长程注意力变体被提出。尽管该方向研究丰富,在实际用例中(例如遵循预训练-微调范式应用这些模型时)仍难以衡量这些模型的相对有效性。本工作中,我们旨在通过这些新兴模型的大规模受控实验进行透彻分析。对于每个注意力变体,我们使用同一长文档语料预训练大尺寸模型,随后将这些模型微调用于真实世界长上下文任务。我们的发现揭示了现有广泛使用的长程基准的缺陷,并表明在标准预训练范式下,所测高效注意力均无法击败简单的局部窗口注意力。对局部注意力变体的进一步分析表明,即便常用的注意力窗口重叠对于取得良好下游结果亦非必要——利用不相交局部注意力,我们能够构建一种更简单且更高效的长文档 QA 模型,以一半的预训练计算量匹配 Longformer 的性能。复现实验的代码见 https://github.com/pytorch/fairseq/tree/main/examples/xformers
引用
@article{arxiv.2112.07210,
title = {Simple Local Attentions Remain Competitive for Long-Context Tasks},
author = {Wenhan Xiong and Barlas Oğuz and Anchit Gupta and Xilun Chen and Diana Liskovich and Omer Levy and Wen-tau Yih and Yashar Mehdad},
journal= {arXiv preprint arXiv:2112.07210},
year = {2022}
}
备注
NAACL 2022 Main Conference