对比预训练模型的数据集所有权验证
机器学习
2025-02-12 v1 人工智能
计算机视觉与模式识别
摘要
高质量开源数据集已成为深度学习快速进步的主要催化剂,而保护这些数据集的所有权对于数据拥有者的利益至关重要。数据集所有权验证作为关键方法之一,但现有方法常局限于监督模型,无法直接扩展到日益流行的无监督预训练模型。在本工作中,我们提出首个专为自监督预训练模型设计的数据集所有权验证方法,基于对比学习。其主要目标是确定可疑黑盒主干网络是否在特定无标签数据集上进行预训练,以帮助数据拥有者维护其权利。我们的方法源于经验洞见:当模型训练于目标数据集时,嵌入空间中单体和二元实例关系与未使用目标数据集训练的模型存在显著差异。我们在包括 SimCLR、BYOL、SimSiam、MOCO v3 和 DINO 在内的多种对比预训练模型上验证了该方法的有效性。结果表明,我们的方法以显著低于0.05的 p 值拒绝原假设,超越了所有前述方法。我们的代码已公开于https://github.com/xieyc99/DOV4CL。
引用
@article{arxiv.2502.07276,
title = {Dataset Ownership Verification in Contrastive Pre-trained Models},
author = {Yuechen Xie and Jie Song and Mengqi Xue and Haofei Zhang and Xingen Wang and Bingde Hu and Genlang Chen and Mingli Song},
journal= {arXiv preprint arXiv:2502.07276},
year = {2025}
}
备注
Accepted by ICLR2025