SummScore:基于 Cross-Encoder 的摘要质量综合评价指标
计算与语言
2022-07-12 v1 信息检索
摘要
文本摘要模型通常被训练以生成满足人类质量要求的摘要。然而,现有的摘要文本评价指标仅是摘要质量的粗略替代,存在与人类评分相关性低以及抑制摘要多样性的问题。为解决这些问题,我们提出 SummScore,一种基于 CrossEncoder 的摘要质量综合评价指标。首先,通过采用原文-摘要度量模式并比较原文语义,SummScore 摆脱了摘要多样性的抑制。借助文本匹配预训练的 Cross-Encoder,SummScore 能有效捕捉摘要语义间的细微差异。其次,为提升全面性与可解释性,SummScore 由四个细粒度子模型组成,分别度量连贯性(Coherence)、一致性(Consistency)、流畅性(Fluency)和相关性(Relevance)。我们使用半监督多轮训练来提升模型在极有限标注数据上的性能。大量实验表明,SummScore 在上述四个维度上与人类评分的相关性显著优于现有评价指标。我们还提供了 SummScore 在 16 个主流摘要模型上的质量评估结果以供后续研究。
引用
@article{arxiv.2207.04660,
title = {SummScore: A Comprehensive Evaluation Metric for Summary Quality Based on Cross-Encoder},
author = {Wuhang Lin and Shasha Li and Chen Zhang and Bin Ji and Jie Yu and Jun Ma and Zibo Yi},
journal= {arXiv preprint arXiv:2207.04660},
year = {2022}
}
备注
Accept to APWeb-WAIM2022