中文

用于长篇叙事事实总结的 Agent-as-Judge 框架

计算与语言 2025-10-01 v3

摘要

大型语言模型 (LLM) 在基于传统指标如 ROUGE 和 BERTScore 的摘要任务中已展现出接近人类的性能。然而,这些指标不足以充分捕捉如以10万token计的长叙事文本摘要质量的关键方面,如事实准确性,尤其在理解人物关系与状态方面仍存在事实不一致问题。近期进展如 LLM-as-a-Judge 虽缓解了基于词汇相似性指标的局限性,但仍 exhibit 事实不一致。本文引入 NarrativeFactScore,一种 novel "Agent-as-Judge" 框架用于评估和细化摘要。通过从输入与生成摘要中提取角色知识图 (CKG),NarrativeFactScore 评估事实一致性并提供可操作的细化指导,如识别遗漏或错误的事实。我们通过详细的工作流程示意和广泛的基准测试验证了 NarrativeFactScore 的有效性,显示出优于竞争方法的优异性能。我们的结果凸显了 agent-driven 评估系统在提高 LLM 生成摘要的事实可靠性方面的潜力。

关键词

引用

@article{arxiv.2501.09993,
  title  = {Agent-as-Judge for Factual Summarization of Long Narratives},
  author = {Yeonseok Jeong and Minsoo Kim and Seung-won Hwang and Byung-Hak Kim},
  journal= {arXiv preprint arXiv:2501.09993},
  year   = {2025}
}