通过对抗域对齐窃取医学多模态模型
密码学与安全
2025-02-05 v1 人工智能
摘要
医学多模态大语言模型(MLLM)正成为医疗保健系统的重要组成部分,辅助医务人员进行决策和结果分析。用于放射报告生成的模型能够解读医学影像,从而减轻放射科医生的工作负担。由于医学数据稀缺且受隐私法规保护,医学 MLLM 代表了宝贵的知识产权。然而,这些资产可能容易受到模型窃取攻击,攻击者旨在通过黑盒访问复制其功能。迄今为止,医学领域的模型窃取主要集中在分类任务上;然而,现有攻击对 MLLM 并不有效。在本文中,我们介绍了对抗域对齐(ADA-STEAL),这是针对医学 MLLM 的首次窃取攻击。ADA-STEAL 依赖于公开且广泛可用的自然图像,而非其医学对应物。我们证明,使用对抗噪声进行数据增强足以克服自然图像与受害者 MLLM 的领域特定分布之间的数据分布差距。在 IU X-RAY 和 MIMIC-CXR 放射学数据集上的实验表明,对抗域对齐使攻击者能够在无需访问任何医学数据的情况下窃取医学 MLLM。
引用
@article{arxiv.2502.02438,
title = {Medical Multimodal Model Stealing Attacks via Adversarial Domain Alignment},
author = {Yaling Shen and Zhixiong Zhuang and Kun Yuan and Maria-Irina Nicolae and Nassir Navab and Nicolas Padoy and Mario Fritz},
journal= {arXiv preprint arXiv:2502.02438},
year = {2025}
}
备注
Accepted at AAAI 2025