重新审视用于基于NLI的摘要事实性评分的文本分解方法
计算与语言
2022-12-01 v1
摘要
对生成摘要的事实性进行评分,涉及以输入文档为支撑来衡量目标文本包含事实信息的程度。鉴于问题表述的相似性,先前工作已表明自然语言推理(NLI)模型可被有效重新用于执行该任务。由于这些模型被训练为在句子级别对蕴含进行评分,近期若干研究已表明将输入文档或摘要分解为句子有助于事实性评分。但细粒度分解是否总是一种制胜策略?在本文中,我们系统性地比较了从文档到子句层面的不同分解粒度,并表明答案是否定的。我们的结果表明,引入额外上下文可带来改进,但这未必适用于所有数据集。我们还表明,对先前提出的基于蕴含的评分方法进行微小改动即可获得更优性能,这凸显了在下游任务中谨慎选择模型与方法论的必要性。
引用
@article{arxiv.2211.16853,
title = {Revisiting text decomposition methods for NLI-based factuality scoring of summaries},
author = {John Glover and Federico Fancellu and Vasudevan Jagannathan and Matthew R. Gormley and Thomas Schaaf},
journal= {arXiv preprint arXiv:2211.16853},
year = {2022}
}
备注
Generation, Evaluation & Metrics (GEM) Workshop 2022