中文

DeepFact:用于深度研究事实性的演进式基准与智能体

人工智能 2026-04-07 v2

摘要

搜索增强型LLM智能体可以生成深度研究报告(DRR),但对主张层面的事实性核查仍具有挑战性。现有事实核查工具主要为通用领域、事实型原子性主张设计,缺乏测试此类核查工具是否能迁移到DRR的基准。但构建此类基准本身就颇具困难。我们首先表明,静态专家标注的基准在此设置下脆弱:在针对隐藏微型金标准集的可验证主张的控制研究中,未获得帮助的专家仅达60.8%的准确率。我们提出了通过审计后计分(Audit-then-Score,AtS)的演进式基准构建方法,其中基准标签和论证均可被明确修订:当核查者与当前基准不同意时,必须提交证据;审计员仲裁争议;并接受的修订在模型评分之前更新基准。在四轮AtS中,专家微型金标准准确率提升至90.9%,表明专家作为审计员显著可靠于作为一次性标注者。我们将AtS实现为DeepFact-Bench,一个具有可审计论证的版本化DRR事实性基准,以及DeepFact-Eval,一个文档级验证智能体(附带精简变体),其在DeepFact-Bench上超越现有核查工具,并在外部事实性数据集上表现出良好迁移能力。

关键词

引用

@article{arxiv.2603.05912,
  title  = {DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality},
  author = {Yukun Huang and Leonardo F. R. Ribeiro and Momchil Hardalov and Bhuwan Dhingra and Markus Dreyer and Venkatesh Saligrama},
  journal= {arXiv preprint arXiv:2603.05912},
  year   = {2026}
}