BadCLM:面向电子健康记录的临床语言模型后门攻击
计算与语言
2024-07-09 v1 人工智能
摘要
将临床语言模型集成到电子健康记录(EHR)中以支持临床决策,标志着利用临床笔记的深度来改进决策的重大进步。尽管取得了成功,但这些模型的潜在脆弱性在很大程度上仍未得到探索。本文深入研究了针对临床语言模型的后门攻击领域,介绍了一种创新的基于注意力的后门攻击方法BadCLM(Bad Clinical Language Models)。该技术隐蔽地将后门嵌入模型中,导致模型在输入中存在预定义触发器时产生错误预测,而在其他情况下则准确运行。我们通过使用MIMIC III数据集进行院内死亡率预测任务,展示了BadCLM的有效性,证明了其破坏模型完整性的潜力。我们的发现揭示了临床决策支持系统中的重大安全风险,并为未来加强临床语言模型抵御此类脆弱性的工作铺平了道路。
引用
@article{arxiv.2407.05213,
title = {BadCLM: Backdoor Attack in Clinical Language Models for Electronic Health Records},
author = {Weimin Lyu and Zexin Bi and Fusheng Wang and Chao Chen},
journal= {arXiv preprint arXiv:2407.05213},
year = {2024}
}
备注
AMIA 2024