中文

AdversaRiskQA:面向高风险领域的对抗性事实性基准

计算与语言 2026-01-23 v1 计算机与社会

摘要

大型语言模型 (LLM) 中的幻觉仍然是一个严峻的问题,它助长了错误信息的传播并削弱了公众信任,尤其是在高风险领域。在各类幻觉中,事实性至关重要,因为它涉及模型与既定世界知识的一致性。对抗性事实性定义为以不同置信度水平故意将错误信息插入提示中,测试模型检测和抵抗带有自信框架的虚假信息的能力。现有工作缺乏在此类对抗条件下评估模型鲁棒性的高质量、特定领域资源,且先前没有研究探讨注入的错误信息对长文本事实性的影响。为了填补这一空白,我们引入了 AdversaRiskQA,这是首个系统评估健康、金融和法律领域对抗性事实性的经验证且可靠的基准。该基准包含两个难度级别,以测试 LLM 在不同知识深度下的防御能力。我们提出了两种自动化方法来评估对抗攻击成功率和长文本事实性。我们评估了来自 Qwen、GPT-OSS 和 GPT 家族的六个开源和闭源 LLM,测量了错误信息检测率。在基线和对抗条件下,对 Qwen3 (30B) 的长文本事实性进行了评估。结果表明,在排除无意义响应后,Qwen3 (80B) 取得了最高的平均准确率,而 GPT-5 保持了持续的高准确率。性能随模型大小呈非线性缩放,因领域而异,且随着模型增大,难度级别之间的差距缩小。长文本评估显示,注入的错误信息与模型的事实输出之间没有显著相关性。AdversaRiskQA 为精确定位 LLM 弱点并为高风险应用开发更可靠的模型提供了一个有价值的基准。

关键词

引用

@article{arxiv.2601.15511,
  title  = {AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains},
  author = {Adam Szelestey and Sofie van Engelen and Tianhao Huang and Justin Snelders and Qintao Zeng and Songgaojun Deng},
  journal= {arXiv preprint arXiv:2601.15511},
  year   = {2026}
}

备注

13 pages, 4 figures, and 11 tables