不造成伤害?Web 部署的医学大语言模型中的幻觉与行为者级滥用
计算与语言
2026-05-21 v1 计算机与社会
摘要
医学大语言模型 (MedGPTs),包括定制医学 GPT 和开源模型,正日益在 web 平台上部署,以提供临床指导。然而,这些模型存在幻觉、政策不合规和不安全设计的风险。我们对 6,233 个 MedGPT 进行大规模评估,评估其中 1,500 个样本,以及 10 个开源 LLM。我们引入两个框架:用于幻觉检测的 MedGPT-HEval 以及用于评估政策违规和开发者意图的 LLM 驱动管道。我们的结果显示,25-30% 的 MedGPTs 表现出低事实准确性,其中底层和中层模型风险最高;33.6-54.3% 违反运营阈值,57.06% 的启用动作的模型缺乏 adequate 隐私披露。与开源模型相比,MedGPTs 在事实准确性和语义对齐方面取得更好成绩,尽管开源模型更稳定。这些结果揭示了幻觉和合规性方面的系统性缺口,凸显了需要多指标评估和更强监管的必要性。我们发布 HAA-MedGPT,一个结构化数据集,支持未来研究医学 web 面向 LLM 的安全性。
引用
@article{arxiv.2605.20591,
title = {Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models},
author = {Sunday Oyinlola Ogundoyin and Muhammad Ikram and Rahat Masood},
journal= {arXiv preprint arXiv:2605.20591},
year = {2026}
}