中文

CBW:通过基于聚类的后门水印实现说话人验证的数据集所有权验证

密码学与安全 2025-04-08 v3 人工智能 机器学习 声音 音频与语音处理

摘要

随着深度学习在说话人验证中的日益普及,大规模语音数据集已成为宝贵的知识产权。为了审计和防止这些已发布的宝贵数据集被未经授权使用,特别是在商业或开源场景中,我们提出了一种新颖的数据集所有权验证方法。我们的方法引入了基于聚类的后门水印(CBW),使数据集所有者能够在黑盒设置下确定可疑的第三方模型是否在受保护的数据集上进行了训练。CBW 方法包含两个关键阶段:数据集水印和所有权验证。在打水印阶段,我们在数据集中植入多个触发模式,使相似样本(由其特征相似度衡量)靠近同一触发器,而不相似样本靠近不同的触发器。这确保了任何在水印数据集上训练的模型在暴露于包含触发器的输入时都会表现出特定的误分类行为。为了验证数据集所有权,我们设计了一个基于假设检验的框架,以统计评估可疑模型是否表现出预期的后门行为。我们在基准数据集上进行了广泛的实验,验证了我们方法的有效性和鲁棒性,以抵御潜在的自适应攻击。用于重现主要实验的代码可在 https://github.com/Radiant0726/CBW 获取。

关键词

引用

@article{arxiv.2503.05794,
  title  = {CBW: Towards Dataset Ownership Verification for Speaker Verification via Clustering-based Backdoor Watermarking},
  author = {Yiming Li and Kaiying Yan and Shuo Shao and Tongqing Zhai and Shu-Tao Xia and Zhan Qin and Dacheng Tao},
  journal= {arXiv preprint arXiv:2503.05794},
  year   = {2025}
}

备注

14 pages. The journal extension of our ICASSP'21 paper (arXiv:2010.11607)