为摘要评估校准模型基准准
计算与语言
2026-04-21 v1
摘要
近期的摘要评估进展基于模型基准方法来评估质量维度,如完整性、简洁性和忠实性。然而,这些方法通常需要大型语言模型,预测分数常常不准确,限制了其可靠性。此外,评估单个文档不同摘要的平均质量通常需要访问多个参考摘要。我们提出一种通用框架,用于无需依赖参考摘要、人工标注或昂贵的模型基准方法来生成个体和平均代理分数。我们还提出了组单调回归分箱(group isotonic regression binning, GIRB)校准方法,调整原始预测以更好地对齐ground-truth评估指标。虽然我们关注连续值场景,如摘要,但该方法也适用于离散值任务,如问答。实验在七个数据集上表明,我们的方法始终优于现有基线方法。
引用
@article{arxiv.2604.17200,
title = {Calibrating Model-Based Evaluation Metrics for Summarization},
author = {Hongye Liu and Dhanajit Brahma and Ricardo Henao},
journal= {arXiv preprint arXiv:2604.17200},
year = {2026}
}