DIAL-SUMMER:面向层次化错误评估的对话摘要结构化评估框架
计算与语言
2026-02-10 v1 人工智能
摘要
对话是人类沟通的主要方式,自动生成的摘要对于复盘会议要点、审阅客户服务人员与用户之间的对话等方面具有极大帮助。先前的对话摘要评估工作很少关注此任务特有的复杂性:(i) 从多个说话者在多个回合中零散讨论信息,转向摘要句子的结构;(ii) 从说话者的第一/第二人称叙述,转向摘要中标准的第三人称叙述。为此,我们引入我们的框架 DIALSUMMER。我们提出 DIAL-SUMMER 的错误分类法,以全面评估对话摘要的两个层次结构:关注更广泛说话者/回合的 DIALOGUE 级别;关注单个回合内讨论信息的 WITHIN-TURN 级别。随后我们呈现 DIAL-SUMMER 的数据集,包含使用我们分类法标注的细粒度错误。我们对这些标注错误进行经验性分析,观察到有趣的趋势(例如,对话中后期回合最常被遗漏在摘要中,外部幻觉大多发生在摘要末尾)。我们还通过实验评估 LLM-Judge 在检测这些错误方面的能力,从而展示了本数据集的具挑战性、我们分类法的稳健性,以及该领域需要提升 LLM 在此方面性能的需求。代码和推理数据即将发布。
引用
@article{arxiv.2602.08149,
title = {DIAL-SUMMER: A Structured Evaluation Framework of Hierarchical Errors in Dialogue Summaries},
author = {Sahana Ramnath and Nima Chitsazan and Mingyang Zhou and Chia-Hsuan Lee and Shi-Xiong Zhang and Stephen Rawls and Sambit Sahu and Sangwoo Cho and Xiang Ren and Genta Indra Winata and Akshaj Kumar Veldanda},
journal= {arXiv preprint arXiv:2602.08149},
year = {2026}
}