保护医疗预训练语言模型版权:免训练后门模型水印
机器学习
2025-04-16 v2 人工智能
密码学与安全
摘要
随着智慧医疗的发展,医疗预训练语言模型(Med-PLMs)应运而生,并在下游医疗任务中展现出显著的有效性。尽管这些模型是宝贵的资产,但它们容易遭到滥用和窃取,因此需要版权保护。然而,由于领域-任务不匹配以及水印嵌入效率低下,现有的预训练语言模型(PLMs)水印方法无法直接应用于 Med-PLMs。为了填补这一空白,我们提出了首个针对 Med-PLMs 的免训练后门模型水印方法。该方法采用低频词作为触发器,通过将模型词嵌入层中触发词的嵌入替换为特定医疗术语的嵌入来嵌入水印。加水印后的 Med-PLMs 对触发器产生的输出与对相应指定医疗术语产生的输出相同。我们利用这种独特的映射关系,为不同的下游任务设计了量身定制的水印提取方案,从而解决了以往方法中领域-任务不匹配的挑战。实验表明,我们的水印方法在医疗下游任务中表现出卓越的有效性。此外,该方法对模型提取、剪枝、基于融合的后门移除攻击表现出鲁棒性,同时保持了10秒水印嵌入的高效率。
引用
@article{arxiv.2409.10570,
title = {Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking},
author = {Cong Kong and Rui Xu and Weixi Chen and Jiawei Chen and Zhaoxia Yin},
journal= {arXiv preprint arXiv:2409.10570},
year = {2025}
}
备注
9 pages