用于抽象摘要推理时内容选择的注意力头掩码
计算与语言
2021-04-07 v1
摘要
我们如何能有效引导基于 Transformer 的抽象摘要模型中的内容选择?本工作中,我们提出一种简单而有效的注意力头掩码技术,应用于编码器-解码器注意力,以在推理时定位显著内容。利用注意力头掩码,我们能够揭示编码器-解码器注意力与摘要模型内容选择行为之间的关系。随后我们在三个文档摘要数据集上基于域内与跨域设置展示了其有效性。重要的是,我们的模型在 CNN/Daily Mail 与 New York Times 数据集上优于先前的 state-of-the-art 模型。此外,我们的推理时掩码技术也具有数据效率,仅需 20% 的训练样本即可优于在全 CNN/DailyMail 数据集上微调的 BART。
引用
@article{arxiv.2104.02205,
title = {Attention Head Masking for Inference Time Content Selection in Abstractive Summarization},
author = {Shuyang Cao and Lu Wang},
journal= {arXiv preprint arXiv:2104.02205},
year = {2021}
}
备注
Accepted at NAACL 2021 (short paper)