面向长文档理解的块级自注意力
计算与语言
2020-11-03 v2 机器学习
摘要
我们提出 BlockBERT,一种轻量且高效的 BERT 模型,用于更好地建模长距离依赖。我们的模型通过向注意力矩阵中引入稀疏块结构来扩展 BERT,以降低内存消耗和训练/推理时间,同时也使注意力头能够捕获短程或长程上下文信息。我们在语言模型预训练以及多个具有不同段落长度的基准问答数据集上进行了实验。BlockBERT 在学习模型时使用的内存减少 18.7-36.1%,时间减少 12.0-25.1%。在测试期间,与先进的基于 BERT 的模型 RoBERTa 相比,BlockBERT 节省了 27.8% 的推理时间,同时具有相当且有时更好的预测精度。
引用
@article{arxiv.1911.02972,
title = {Blockwise Self-Attention for Long Document Understanding},
author = {Jiezhong Qiu and Hao Ma and Omer Levy and Scott Wen-tau Yih and Sinong Wang and Jie Tang},
journal= {arXiv preprint arXiv:1911.02972},
year = {2020}
}
备注
Accepted at Findings of EMNLP'20 and SustaiNLP 2020 at EMNLP'20, 12 pages