中文

不造成伤害?Web 部署的医学大语言模型中的幻觉与行为者级滥用

计算与语言 2026-05-21 v1 计算机与社会

摘要

医学大语言模型 (MedGPTs),包括定制医学 GPT 和开源模型,正日益在 web 平台上部署,以提供临床指导。然而,这些模型存在幻觉、政策不合规和不安全设计的风险。我们对 6,233 个 MedGPT 进行大规模评估,评估其中 1,500 个样本,以及 10 个开源 LLM。我们引入两个框架:用于幻觉检测的 MedGPT-HEval 以及用于评估政策违规和开发者意图的 LLM 驱动管道。我们的结果显示,25-30% 的 MedGPTs 表现出低事实准确性,其中底层和中层模型风险最高;33.6-54.3% 违反运营阈值,57.06% 的启用动作的模型缺乏 adequate 隐私披露。与开源模型相比,MedGPTs 在事实准确性和语义对齐方面取得更好成绩,尽管开源模型更稳定。这些结果揭示了幻觉和合规性方面的系统性缺口,凸显了需要多指标评估和更强监管的必要性。我们发布 HAA-MedGPT,一个结构化数据集,支持未来研究医学 web 面向 LLM 的安全性。

关键词

引用

@article{arxiv.2605.20591,
  title  = {Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models},
  author = {Sunday Oyinlola Ogundoyin and Muhammad Ikram and Rahat Masood},
  journal= {arXiv preprint arXiv:2605.20591},
  year   = {2026}
}