数据集投毒启用水印在对比学习中的可行性评估与再利用
密码学与安全
2026-05-05 v1 人工智能
摘要
对比学习(CL)通过自动派生的监督信号降低标注成本。由于大规模内部 CL 数据集不可行,依赖第三方或互联网数据常见。近期研究表明 CL 模型对数据投毒后门攻击十分脆弱,但其泛化性和鲁棒性尚未得到充分探讨。我们系统评估了现有数据投毒后门攻击在 CL 上的应用,揭示了其局限性:数据集适应性差、成功率低、可移植性有限,以及依赖限制性假设(例如下游任务知识)。意外的是,触发样本与干净样本之间存在可辨别的统计分布偏差,这激发了将其作为数据集知识产权保护水印的想法。直接再利用困难,因为成功率低;我们通过统一密度度量进行统计验证来克服这一问题。进一步,我们提出一种多级水印方案,适应 CL 中的特征级、软标签或硬标签输出。实验表明,某些后门攻击可作为有效水印再利用,在保真性、可验证性和鲁棒性之间存在权衡。这一工作表明,后门效应在挑战性的 CL 环境中会成为可靠的信号,用于数据集知识产权保护。
引用
@article{arxiv.2605.01834,
title = {Repurposing and Evaluating the (In)Feasibility of Dataset Poisoning enabled Watermarking for Contrastive Learning},
author = {Zhiyang Dai and Yansong Gao and Boyu Kuang and Haodong Li and Qi Chang and Gaurav Varshney and Derek Abbott and Anmin Fu},
journal= {arXiv preprint arXiv:2605.01834},
year = {2026}
}