介绍 Answered with Evidence —— 用于评估大语言模型对生物医学问题响应是否基于证据的框架
机器学习
2025-07-08 v1 信息检索
摘要
大型语言模型(LLM)用于生物医学问答应用日益增长,引发对其响应准确性和证据支持性的担忧。为此,我们提出 Answered with Evidence,一个评估LLM生成答案是否基于科学文献的框架。我们对分析了数千个医生提交的提问,构建了一个包含以下比较管道的评估系统:(1)Alexandria(前身为阿特罗波斯证据库),这是基于新颖观察性研究的检索增强生成(RAG)系统;(2)两个基于PubMed的检索增强系统(System 和 Perplexity)。我们发现,PubMed-based系统在约44%的问题上提供了基于证据的答案,而新型证据来源则在约50%的问题上提供了支持性答案。合并这两类证据来源后,能够可靠地解答超过70%的生物医学查询。随着LLM在总结科学内容方面能力的提升,其价值最大化将requires能够准确检索已发布和自定义证据,或在实时生成证据的系统。
引用
@article{arxiv.2507.02975,
title = {Introducing Answered with Evidence -- a framework for evaluating whether LLM responses to biomedical questions are founded in evidence},
author = {Julian D Baldwin and Christina Dinh and Arjun Mukerji and Neil Sanghavi and Saurabh Gombar},
journal= {arXiv preprint arXiv:2507.02975},
year = {2025}
}
备注
17 pages; 3 figures; 3 main tables. This work will be submitted for full publication shortly;wanted to share ahead of industry conference