中文

信任但验证:引入DAVinCI——用于语言模型中的双重归因与验证框架

人工智能 2026-04-24 v1

摘要

大型语言模型(LLMs)在广泛的NLP任务中展现出惊人的流畅性和多样性,但仍容易出现事实性错误和幻觉。这种局限性在医疗、法律和科学传播等高风险领域构成重大风险,因而信任性和可验证性至关重要。在本文中,我们引入DAVinCI——一个双重归因与验证框架,用于增强LLM输出的事实可靠性和可解释性。DAVinCI在两个阶段运行:(i)它将生成的声明归因于内部模型组件和外部来源;(ii)它使用蕴涵推理和置信度校准对每个声明进行验证。我们在多个数据集上评估了DAVinCI,包括FEVER和CLIMATE-FEVER,并将其性能与标准仅验证基线进行比较。我们的结果表明,DAVinCI在分类准确率、归因精确率、召回率和F1分数方面提升了5-20%。通过大规模消融研究,我们隔离了证据片段选择、校准阈值以及检索质量的贡献。我们还发布了一个可模块化集成到现有LLM管道中的DAVinCI实现。通过连接归因与验证,DAVinCI为可审计、可信赖的AI系统提供了可扩展路径。本工作促进了使LLM不仅强大而且负责任的努力。

关键词

引用

@article{arxiv.2604.21193,
  title  = {Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models},
  author = {Vipula Rawte and Ryan Rossi and Franck Dernoncourt and Nedim Lipka},
  journal= {arXiv preprint arXiv:2604.21193},
  year   = {2026}
}