在长文档抽取式摘要中解耦内容与预算决策
计算与语言
2022-10-27 v2
摘要
我们认为,将内容选择与用于覆盖显著内容的预算解耦,可提升抽取式摘要器的性能与适用性。我们的方法 FactorSum 通过能量函数将摘要分解为两步来实现这种解耦:(1)生成抽取式摘要视图;(2)遵循预算与内容引导将这些视图组合为最终摘要。该引导可来自不同来源,包括来自诸如 BART 或 BigBird 的顾问模型,或以 oracle 模式——来自参考摘要。这种分解在多个长文档摘要基准(即 PubMed、arXiv 和 GovReport)上取得了显著更高的 ROUGE 分数。最值得注意的是,我们的模型对领域自适应有效。当仅在 PubMed 样本上训练时,它在 arXiv 上取得了 46.29 的 ROUGE-1 分数,这表明由于更灵活的预算自适应和较少依赖领域特定文本结构的内容选择而具有强劲性能。
引用
@article{arxiv.2205.12486,
title = {Factorizing Content and Budget Decisions in Abstractive Summarization of Long Documents},
author = {Marcio Fonseca and Yftah Ziser and Shay B. Cohen},
journal= {arXiv preprint arXiv:2205.12486},
year = {2022}
}
备注
EMNLP 2022 camera ready