迈向安全的AI临床医生:医疗领域大语言模型越狱综合研究
密码学与安全
2025-03-05 v2 计算与语言
摘要
大语言模型(LLM)在医疗应用中的使用日益增多。然而,它们在临床实践中的部署引发了显著的安全担忧,包括潜在的有害信息传播。本研究系统评估了七种LLM在医疗背景下对三种先进黑盒越狱技术的脆弱性。为量化这些技术的有效性,我们提出了一种自动化且领域自适应的智能体评估流程。实验结果表明,领先的商业和开源LLM高度易受医疗越狱攻击。为增强模型安全性和可靠性,我们进一步研究了持续微调(CFT)在防御医疗对抗攻击中的有效性。我们的发现强调了评估不断演变的攻击方法、领域特定的安全对齐以及LLM安全-效用平衡的必要性。本研究为提升AI临床医生的安全性和可靠性提供了可操作的见解,有助于在医疗保健中实现道德且有效的AI部署。
引用
@article{arxiv.2501.18632,
title = {Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare},
author = {Hang Zhang and Qian Lou and Yanshan Wang},
journal= {arXiv preprint arXiv:2501.18632},
year = {2025}
}