SEval-Ex:一个面向可解释摘要评估的陈述级框架
计算与语言
2025-05-06 v1 人工智能
摘要
评估文本摘要质量仍然是自然语言处理中的一个关键挑战。当前方法在性能和可解释性之间面临权衡。我们提出了SEval-Ex,一个通过将摘要评估分解为原子陈述来弥合这一差距的框架,从而同时实现高性能和可解释性。SEval-Ex采用两阶段流程:首先使用大语言模型(LLM)从文本源和摘要中提取原子陈述,然后在生成的陈述之间进行匹配。与仅提供摘要级评分的现有方法不同,我们的方法通过陈述级的对齐为其决策生成详细的证据。在SummEval基准上的实验表明,SEval-Ex在与人类一致性判断的相关性上达到了0.580的最先进性能,超越了基于GPT-4的评估器(0.521),同时保持了可解释性。最后,我们的框架展示了对幻觉的鲁棒性。
引用
@article{arxiv.2505.02235,
title = {SEval-Ex: A Statement-Level Framework for Explainable Summarization Evaluation},
author = {Tanguy Herserant and Vincent Guigue},
journal= {arXiv preprint arXiv:2505.02235},
year = {2025}
}