基于局部注意力与内容选择的长跨度摘要
计算与语言
2021-06-01 v2
摘要
基于 Transformer 的模型已在包括文档摘要在内的广泛自然语言处理(NLP)任务中取得最先进结果。通常这些系统通过对大型预训练模型进行微调以适配目标任务来训练。这些基于 Transformer 的模型的一个问题是,随着输入长度增长,其在内存和计算需求方面扩展性不佳。因此,对于长文档摘要,训练或微调这些模型可能具有挑战性。在本工作中,我们利用大型预训练基于 Transformer 的模型,并使用两种方法解决抽象摘要中的长跨度依赖:局部自注意力;以及显式内容选择。这些方法在一系列网络配置上进行了比较。实验在标准长跨度摘要任务上进行,包括 Spotify Podcast、arXiv 和 PubMed 数据集。我们证明,通过结合这些方法,我们可以在 ROUGE 分数上于所有三个任务中取得最先进结果。此外,无需大规模 GPU 卡,我们的方法即可取得与现有方法相当或更好的结果。
引用
@article{arxiv.2105.03801,
title = {Long-Span Summarization via Local Attention and Content Selection},
author = {Potsawee Manakul and Mark J. F. Gales},
journal= {arXiv preprint arXiv:2105.03801},
year = {2021}
}
备注
ACL 2021 (camera-ready)