超越原子事实的信息对齐评估
计算与语言
2025-05-22 v1 人工智能
机器学习
摘要
信息对齐评估器是各种 NLG 评估任务和可靠 LLM 部署中至关重要的工具,能够减少幻觉并提升用户信任。当前的细粒度方法,如 FactScore,逐个验证事实,但忽略事实之间的相互依赖,导致潜在的细微漏洞。本文引入 MontageLie,一个具有挑战性的基准测试,通过“拼贴”真实陈述而无需引入明显幻觉来构建欺骗性叙事。我们展示,无论是粗粒度基于 LLM 的评估器还是当前的细粒度框架都容易受到此攻击,AUC-ROC 分数下降到 65% 以下。为实现更稳健的细粒度评估,我们提出了 DoveScore,一种新型框架,联合验证事实准确性和事件顺序一致性。通过建模事实之间的关系,DoveScore 在现有细粒度方法上超越 8%,为长篇文本对齐评估提供了更稳健的解决方案。我们的代码和数据集已在 https://github.com/dannalily/DoveScore 上提供。
引用
@article{arxiv.2505.15792,
title = {Long-Form Information Alignment Evaluation Beyond Atomic Facts},
author = {Danna Zheng and Mirella Lapata and Jeff Z. Pan},
journal= {arXiv preprint arXiv:2505.15792},
year = {2025}
}