面向预训练掩码模型的数据集所有权验证
计算机视觉与模式识别
2025-07-17 v1
摘要
高质量的开源数据集已成为深度学习快速发展的关键驱动力,同时也面临潜在被滥用的威胁。保护这些数据集对数据所有者的利益至关重要。数据集所有权验证已发展为此领域的关键方法;然而,现有验证技术主要针对监督模型和对比式预训练模型,难以直接应用于日益普及的掩码模型。在本工作中,我们提出了首个针对这一临界且尚未解决挑战的方法,称为面向掩码建模的数据集所有权验证 (Dataset Ownership Verification for Masked Modeling, DOV4MM)。其核心目标是确定可疑的黑箱模型是否预训练于特定的无标签数据集,从而帮助数据所有者保护其权利。DOV4MM 基于我们对模型在目标数据集上预训练后,其在嵌入空间中重建被掩码信息难度的实证观察得出。在 ImageNet-1K 上的十个掩码图像模型和 WikiText-103 上的四个掩码语言模型上,我们验证了 DOV4MM 的有效性。结果表明,DOV4MM 拒绝原假设,其 -值远低于 0.05,超过了所有先前方法。代码已公开于 https://github.com/xieyc99/DOV4MM。
引用
@article{arxiv.2507.12022,
title = {Dataset Ownership Verification for Pre-trained Masked Models},
author = {Yuechen Xie and Jie Song and Yicheng Shan and Xiaoyan Zhang and Yuanyu Wan and Shengxuming Zhang and Jiarui Duan and Mingli Song},
journal= {arXiv preprint arXiv:2507.12022},
year = {2025}
}
备注
Accepted by ICCV 2025