寻找文档中的不一致问题
计算与语言
2025-12-23 v1
摘要
学术、法律和金融领域的专业人士对文件进行审计,因为不一致可能导致金钱、声誉和科研成本。语言模型(LM)有望显著加速这一审计过程。为理解其能力,我们引入了一个基准测试FIND(Finding INconsistencies in Documents),其中每个示例都是由领域专家人工插入不一致的文档。尽管文档长度、技术性和复杂性都很大,最佳表现模型(gpt-5)仍能恢复64%的插入不一致。意外的是,gpt-5还发现了原文档中未被发现的不一致。例如,在50篇arXiv论文中,我们将模型提出的196个建议中,有136个被判定为原作者未发现的合法不一致。然而,尽管如此,即使是最佳模型也 Misses了近一半的不一致,表明不一致检测仍是一个具有挑战性的任务。
引用
@article{arxiv.2512.18601,
title = {On Finding Inconsistencies in Documents},
author = {Charles J. Lovering and Seth Ebner and Brandon Smock and Michael Krumdick and Saad Rabbani and Ahmed Muhammad and Varshini Reddy and Chris Tanner},
journal= {arXiv preprint arXiv:2512.18601},
year = {2025}
}