长文档上快速而准确的事实不一致检测
计算与语言
2024-09-20 v2 人工智能
摘要
生成式 AI 模型展现出卓越潜力;然而,各类任务中的幻觉问题构成重大挑战,尤其是当前方法难以有效处理较长输入的情况。我们提出 SCALE(用于大规模不一致性评估的源分块方法,Source Chunking Approach for Large-scale inconsistency Evaluation),一种基于新颖分块策略、用于检测事实不一致的任务无关模型。具体而言,SCALE 是一个基于自然语言推理(NLI)的模型,利用大文本块对长文本进行条件化。该方法在多种任务及长输入的事实不一致检测中达到了最先进的性能。此外,我们借助分块机制并采用一种新颖算法,通过相关源句子检索来解释 SCALE 的决策。我们的评估表明,SCALE 在标准基准和我们构建的新长形式对话数据集 ScreenEval 上均优于现有方法。而且,SCALE 在效率和模型解释评估中也超越了竞争系统。我们已公开在 GitHub 上发布代码与数据。
引用
@article{arxiv.2310.13189,
title = {Fast and Accurate Factual Inconsistency Detection Over Long Documents},
author = {Barrett Martin Lattimer and Patrick Chen and Xinyuan Zhang and Yi Yang},
journal= {arXiv preprint arXiv:2310.13189},
year = {2024}
}
备注
To be published in EMNLP 2023 Main Conference, 9 pages