中文

大语言模型对患者提出的医学问题提供不安全的回答

计算与语言 2025-08-06 v2 人机交互

摘要

数百万患者已经定期使用大语言模型 (LLM) 聊天机器人获取医疗建议,这引发了患者安全问题。这项由医生主导的红队测试研究,使用一个能够进行定量和定性分析的评估框架,在一个新数据集 HealthAdvice 上比较了四个公开可用的聊天机器人——Anthropic 的 Claude、Google 的 Gemini、OpenAI 的 GPT-4o 和 Meta 的 Llama3-70B——的安全性。总共评估了 888 条聊天机器人对 222 个患者提出的寻求建议的医学问题的回答,这些问题涉及内科、女性健康和儿科等初级保健主题。我们发现聊天机器人之间存在统计学上的显著差异。有问题的回答率从 21.6%(Claude)到 43.2%(Llama)不等,不安全的回答率从 5%(Claude)到 13%(GPT-4o, Llama)不等。定性结果揭示了聊天机器人的回答有可能导致严重的患者伤害。这项研究表明,数百万患者可能正在从公开可用的聊天机器人那里收到不安全的医疗建议,需要进一步的工作来改进这些强大工具的临床安全性。

关键词

引用

@article{arxiv.2507.18905,
  title  = {Large language models provide unsafe answers to patient-posed medical questions},
  author = {Rachel L. Draelos and Samina Afreen and Barbara Blasko and Tiffany L. Brazile and Natasha Chase and Dimple Patel Desai and Jessica Evert and Heather L. Gardner and Lauren Herrmann and Aswathy Vaikom House and Stephanie Kass and Marianne Kavan and Kirshma Khemani and Amanda Koire and Lauren M. McDonald and Zahraa Rabeeah and Amy Shah},
  journal= {arXiv preprint arXiv:2507.18905},
  year   = {2025}
}

备注

20 pages