VISTA:基于顺序轮次评估的验证框架
计算与语言
2026-04-22 v5
摘要
幻觉——此处定义为生成不受可用证据或对话情境支持或矛盾的陈述——仍是部署需要事实可靠性的对话式 AI 系统的主要障碍。现有指标要么评估孤立响应,要么将不可验证内容视为错误,限制了其在多轮对话中的应用。我们提出 VISTA (Verification In Sequential Turn-based Assessment),一个通过主张级验证和顺序一致性跟踪来评估对话事实性的框架。VISTA 将每个助手轮次分解为原子事实主张,针对可信来源和对话历史进行验证,并对不可验证的陈述进行分类(主观性、矛盾、缺乏证据或中止)。在八个大型语言模型和四个对话事实性基准(AIS、BEGIN、FAITHDIAL 和 FADE)上,VISTA 在 FACTSCORE 和 LLM-as-Judge 基准之外显著改进了幻觉检测。人类评估确认,VISTA 的分解提高了标注员一致性,并揭示了现有基准中的不一致性。通过将事实性建模为对话的动态属性,VISTA 提供了更透明、更贴近人类的对话系统真实性度量。
引用
@article{arxiv.2510.27052,
title = {VISTA: Verification In Sequential Turn-based Assessment},
author = {Ashley Lewis and Andrew Perrault and Eric Fosler-Lussier and Michael White},
journal= {arXiv preprint arXiv:2510.27052},
year = {2026}
}
备注
Accepted to ACL 2026