中文

RxSafeBench:在模拟问诊中识别大型语言模型的用药安全问题

人工智能 2025-11-07 v1

摘要

众多基于大型语言模型(LLM)的医疗系统在各类医疗保健任务中取得了显著进展。然而,由于受限于隐私和可及性问题而缺乏真实世界数据集,关于其用药安全的研究仍然有限。此外,在现实临床问诊场景下对 LLM 进行评估,尤其是在用药安全方面,仍处于探索不足的状态。为了填补这些空白,我们提出了一个模拟并评估临床问诊的框架,以系统地评估 LLM 的用药安全能力。在该框架内,我们生成了嵌入用药风险的问诊诊断对话,并构建了一个专门的用药安全数据库 RxRisk DB,其中包含 6,725 项禁忌症、28,781 项药物相互作用以及 14,906 对适应症-药物组合。两阶段过滤策略确保了临床真实性与专业质量,最终形成了包含 2,443 个高质量问诊场景的基准 RxSafeBench。我们使用结构化多项选择题对领先的开源和专有 LLM 进行了评估,以测试它们在模拟患者情境下推荐安全药物的能力。结果表明,当前的 LLM 难以整合禁忌症和相互作用知识,尤其是当风险为隐含而非明示时。我们的发现强调了确保基于 LLM 的系统在用药安全方面面临的关键挑战,并为通过更好的提示工程和特定任务微调来提高可靠性提供了见解。RxSafeBench 提供了首个用于评估 LLM 用药安全的综合基准,推动了更安全、更可信的 AI 驱动临床决策支持的发展。

关键词

引用

@article{arxiv.2511.04328,
  title  = {RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation},
  author = {Jiahao Zhao and Luxin Xu and Minghuan Tan and Lichao Zhang and Ahmadreza Argha and Hamid Alinejad-Rokny and Min Yang},
  journal= {arXiv preprint arXiv:2511.04328},
  year   = {2025}
}

备注

To appear in BIBM2025