VERIRAG:基于后检索的科学研究摘要审计框架
信息检索
2025-12-08 v2 人工智能
摘要
民主化信息门卫和社区注释作者能否有效决定放大什么科学信息?缺乏专业知识的这些门卫依赖于用于以引用来源为依据的自动推理代理,但标准的检索增强生成(RAG)系统仅通过语义 grounding 验证摘要,存在“方法论盲区”,即无视 cited evidence 的严谨性而将其视为等价有效。为此,我们引入 VERIRAG—a 后检索审计框架,将任务从分类转为方法论脆弱性检测。借助私有小型语言模型(SLM),VERIRAG 根据 Veritable 统计严谨性分类学审计源论文。我们贡献了:(1)包含 1,730 篇带现实中非显而易见扰动的基准数据集,这些扰动模仿已撤稿论文;(2)可审计的 Veritable 分类学;(3)一个在使用 GPT 基的 SLM 上至少提升 19 分点的宏平均 F1 分数的实用系统,结果在 MISTRAL 和 Gemma 架构上均得到复制。鉴于检测非显而易见缺陷的复杂性,我们将 VERIRAG 视为“脆弱性检测联合员”,为人类编辑提供结构化审计轨迹。在实验中,个别人类测试者发现超过 80% 的生成审计轨迹对决策有用。我们计划发布数据集和代码以支持负责任的科学倡导。
引用
@article{arxiv.2507.17948,
title = {VERIRAG: A Post-Retrieval Auditing of Scientific Study Summaries},
author = {Shubham Mohole and Hongjun Choi and Shusen Liu and Christine Klymko and Shashank Kushwaha and Derek Shi and Wesam Sakla and Sainyam Galhotra and Ruben Glatt},
journal= {arXiv preprint arXiv:2507.17948},
year = {2025}
}