中文

为摘要评估校准模型基准准

计算与语言 2026-04-21 v1

摘要

近期的摘要评估进展基于模型基准方法来评估质量维度,如完整性、简洁性和忠实性。然而,这些方法通常需要大型语言模型,预测分数常常不准确,限制了其可靠性。此外,评估单个文档不同摘要的平均质量通常需要访问多个参考摘要。我们提出一种通用框架,用于无需依赖参考摘要、人工标注或昂贵的模型基准方法来生成个体和平均代理分数。我们还提出了组单调回归分箱(group isotonic regression binning, GIRB)校准方法,调整原始预测以更好地对齐ground-truth评估指标。虽然我们关注连续值场景,如摘要,但该方法也适用于离散值任务,如问答。实验在七个数据集上表明,我们的方法始终优于现有基线方法。

关键词

引用

@article{arxiv.2604.17200,
  title  = {Calibrating Model-Based Evaluation Metrics for Summarization},
  author = {Hongye Liu and Dhanajit Brahma and Ricardo Henao},
  journal= {arXiv preprint arXiv:2604.17200},
  year   = {2026}
}