学习修订参考文献以实现忠实摘要
计算与语言
2022-10-13 v2
摘要
在具有自然发生数据集的真实场景中,参考摘要含有噪声,可能包含无法从源文本推断的信息。在大型新闻语料库上,移除低质量样本已被证明可减少模型幻觉。然而,对于较小和/或噪声较大的语料库,过滤会损害性能。为了在保留所有数据的同时提高参考质量,我们提出一种新方法:有选择地重写 unsupported 的参考句子以更好地反映源数据。我们通过破坏 supported 句子自动生成正负修订的合成数据集,并借助对比学习学习修订参考句子。修订的强度被视为可控属性,以便在推理时可通过过生成再重打分多样候选来平衡忠实度与抽象度。为测试我们的方法,我们从公开可用的 MIMIC-III 出院小结中提取噪声参考,用于医院病程摘要任务,并改变模型训练所用数据。根据指标和人工评估,在修订临床参考上训练的模型比在原始或过滤数据上训练的模型更忠实、信息更丰富且更流畅。
引用
@article{arxiv.2204.10290,
title = {Learning to Revise References for Faithful Summarization},
author = {Griffin Adams and Han-Chin Shing and Qing Sun and Christopher Winestock and Kathleen McKeown and Noémie Elhadad},
journal= {arXiv preprint arXiv:2204.10290},
year = {2022}
}
备注
Findings of EMNLP 2022