针对非配对医学图像-文本基础模型的后门攻击:基于 MedCLIP 的初步研究
计算机视觉与模式识别
2024-01-05 v1 机器学习
摘要
近年来,基础模型(FMs)已巩固了其作为深度学习领域基石性进展的地位。通过从海量数据集中提取复杂模式,这些模型在广泛的下游任务中持续取得最先进的结果,且无需大量计算资源。值得注意的是,MedCLIP 是一种基于视觉-语言对比学习的医学 FM,采用非配对图像-文本训练设计。尽管医学领域常采用非配对训练来扩充数据,但对与此方法相关的潜在安全问题的探索尚未跟上其实际应用的步伐。值得注意的是,非配对训练固有的数据增强能力也表明,微小的标签差异可能导致显著的模型偏差。在本研究中,我们将这种标签差异界定为后门攻击问题,并进一步分析了其在 FM 供应链中对医学 FM 的影响。我们的评估主要围绕 MedCLIP 展开,它是采用非配对策略的医学 FM 的典型代表。我们首先探索了 MedCLIP 中源于非配对图像-文本匹配的漏洞,称之为 BadMatch。BadMatch 通过使用少量错误标记的数据即可实现。随后,我们通过在干净数据和中毒数据的嵌入之间引入 Bad-Distance,利用 BadDist 辅助的 BadMatch 破坏了 MedCLIP 的对比学习。此外,结合 BadMatch 和 BadDist,该攻击流水线能够在不同的模型设计、数据集和触发器下持续抵御后门攻击。同时,我们的发现揭示了当前的防御策略不足以检测医学 FM 供应链中的这些潜在威胁。
引用
@article{arxiv.2401.01911,
title = {Backdoor Attack on Unpaired Medical Image-Text Foundation Models: A Pilot Study on MedCLIP},
author = {Ruinan Jin and Chun-Yin Huang and Chenyu You and Xiaoxiao Li},
journal= {arXiv preprint arXiv:2401.01911},
year = {2024}
}
备注
Paper Accepted at the 2nd IEEE Conference on Secure and Trustworthy Machine Learning