中文

CareGuardAI:面向临床安全与患者交互型大语言模型 hallucination 防护的情境感知多智能体框架

计算机与社会 2026-05-01 v1 人工智能 多智能体系统

摘要

将大型语言模型(LLM)集成到患者导向的医疗系统中具有显著的潜在价值,有助于提高医疗信息获取的可及性。然而,确保临床安全性和事实可靠性仍是一个关键挑战。实际情况下,AI生成的回复可能在条件上是正确的,但在医学上是不合适的,因为模型往往无法解读患者情境,且倾向于生成令人满意的回复,而非挑战不安全的假设。与临床医生不同,后者会从不完整信息中推断风险,而 LLM 常常缺乏情境意识。此外,现实中的患者交互是开放式且未完全指定的,而与结构化基准设置不同。我们提出 CareGuardAI,一个面向患者导向的医疗问答系统的风险感知安全框架,旨在解决两个关键失效模式:临床安全风险和 hallucination 风险。该框架引入临床安全风险评估(SRA),灵感来自 ISO 14971,并提出 hallucination 风险评估(HRA)以评估医疗风险和事实可靠性。在推理阶段,CareGuardAI 采用由控制器智能体、受安全约束的生成以及双重风险评估组成的多阶段管道,随后在必要时进行迭代细化。只有当 SRA 和 HRA 均小于或等于 2 时,才会发布回复,以确保临床可接受的输出且延迟可控。我们在 PatientSafeBench、MedSafetyBench 和 MedHallu 上对 CareGuardAI 进行评估,涵盖了安全性和 hallucination 检测。我们发现,该框架在包括 GPT-4o-mini 在内的强大基准模型中始终表现出色,证明了面向可靠医疗部署中,情境感知、基于风险的推理时安全机制的重要性。

关键词

引用

@article{arxiv.2604.26959,
  title  = {CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs},
  author = {Elham Nasarian and Abhilash Neog and Kwok-Leung Tsui and Niyousha HosseiniChimeh},
  journal= {arXiv preprint arXiv:2604.26959},
  year   = {2026}
}