HaRiM$^+$:基于幻觉风险评价的摘要质量评估方法
计算与语言
2022-11-28 v2
摘要
开发摘要模型面临的挑战之一在于难以度量生成文本的事实不一致性。在本研究中,我们将 (Miao et al., 2021) 提出的 decoder 过置信正则化目标重新解释为幻觉风险度量,以更好地估计生成摘要的质量。我们提出了一种无参考指标 HaRiM+,它仅需一个现成的摘要模型,基于 token 似然度计算幻觉风险。部署该指标无需额外训练模型或通常需要与人类判断对齐的特设模块。在摘要质量估计方面,HaRiM+ 在 FRANK、QAGS 和 SummEval 三个摘要质量标注集上取得了与人类判断的 SOTA 相关性。我们希望这项值得使用摘要模型的工作,能推动摘要自动评价与生成的进展。
引用
@article{arxiv.2211.12118,
title = {HaRiM$^+$: Evaluating Summary Quality with Hallucination Risk},
author = {Seonil Son and Junsoo Park and Jeong-in Hwang and Junghwa Lee and Hyungjong Noh and Yeonsoo Lee},
journal= {arXiv preprint arXiv:2211.12118},
year = {2022}
}
备注
9 pages (+ 21 pages of Appendix), AACL 2022