DocAsRef:基于参考的摘要质量度量无参考化复用的实证研究
人工智能
2023-11-28 v2 计算与语言
摘要
自动摘要质量评估分为两类:基于参考的和无参考的。基于参考的度量因人工撰写参考所提供的额外信息,历史上被认为更准确,但受限于其对人工输入的依赖。本文中,我们假设某些基于参考的度量用于将系统摘要与其对应参考进行比较的方法论,可有效适配为将其与源文档进行比较,从而将这些度量转化为无参考度量。实验结果支持该假设。在无偿复用为无参考后,使用参数量小于0.5B的预训练DeBERTa-large-MNLI模型的零样本BERTScore在SummEval和Newsroom数据集的各方面持续优于其原始的基于参考版本。与多数现有无参考度量相比它也表现更优,并与基于GPT-3.5的零样本摘要评估器激烈竞争。
引用
@article{arxiv.2212.10013,
title = {DocAsRef: An Empirical Study on Repurposing Reference-Based Summary Quality Metrics Reference-Freely},
author = {Forrest Sheng Bao and Ruixuan Tu and Ge Luo and Yinfei Yang and Hebi Li and Minghui Qiu and Youbiao He and Cen Chen},
journal= {arXiv preprint arXiv:2212.10013},
year = {2023}
}
备注
Accepted into Findings of EMNLP 2023