利用大型语言模型检测维基百科中的语料库级知识不一致性
计算与语言
2025-09-30 v1
摘要
维基百科是最大的开放知识语料库,广泛应用于全球范围,是训练大型语言模型(LLM)和检索增强生成(RAG)系统的关键资源。因此确保其准确性至关重要。但维基百科有多么准确,如何进行改进?我们聚焦于不一致性,这一特定类型的事实性错误,提出语料库级不一致性检测任务。我们 presented CLAIRE,一种智能体系统,结合LLM推理与检索,揭示可能存在的不一致主张并提供人工审核的上下文证据。在经验丰富的维基百科编辑者参与的用户研究中,87.5%的受访者表示使用CLAIRE后信心提升,参与者在相同时间内识别的不一致性数量增加了64.7%。通过将CLAIRE与人工标注结合,我们贡献了WIKICOLLIDE,即首个真实维基百科不一致性基准数据集。使用CLAIRE辅助的随机抽样分析发现,至少3.3%的英文维基百科事实与另一事实相矛盾,不一致性还蔓延到7.3%的FEVEROUS和4.0%的AmbigQA示例中。在该数据集上对强基线进行基准测试,发现仍有显著提升空间:最佳完全自动系统的AUROC仅为75.1%。我们的结果表明,矛盾是维基百科可衡量的组成部分,LLM基于系统如CLAIRE可为编辑器在规模上改善知识一致性提供实用工具。
引用
@article{arxiv.2509.23233,
title = {Detecting Corpus-Level Knowledge Inconsistencies in Wikipedia with Large Language Models},
author = {Sina J. Semnani and Jirayu Burapacheep and Arpandeep Khatua and Thanawan Atchariyachanvanit and Zheng Wang and Monica S. Lam},
journal= {arXiv preprint arXiv:2509.23233},
year = {2025}
}
备注
EMNLP 2025 (Main Conference)