抽象式神经摘要器中的自我重复现象
计算与语言
2022-10-18 v1
摘要
我们对神经摘要器输出中的自我重复进行了定量与定性分析。我们将自我重复度量定义为在同一系统多个输出中出现的、长度为四或更长 n-gram 的数量。我们分析了三种流行架构(BART、T5 和 Pegasus)在五个数据集上微调后的行为。在回归分析中,我们发现三种架构对跨输入输出摘要重复内容具有不同的倾向,其中 BART 尤其易于发生自我重复。在更具抽象性的数据以及具有程式化语言的数据上进行微调,与更高的自我重复率相关。在定性分析中,我们发现系统会产生与所摘要内容无关的广告和免责声明等伪影,以及微调领域中常见的程式化短语。我们这种语料库层面的自我重复分析方法可帮助从业者清理摘要器的训练数据,并最终为最小化自我重复量的方法提供支持。
引用
@article{arxiv.2210.08145,
title = {Self-Repetition in Abstractive Neural Summarizers},
author = {Nikita Salkar and Thomas Trikalinos and Byron C. Wallace and Ani Nenkova},
journal= {arXiv preprint arXiv:2210.08145},
year = {2022}
}