中文

用于黑箱音频数据集所有权验证的定向数据投毒

密码学与安全 2025-03-14 v1 机器学习

摘要

保护音频数据集的使用是数据所有者的主要关切,尤其是在音频深度学习模型近期兴起的背景下。虽然水印可用于保护数据本身,但它们无法识别在受保护数据集上训练的深度学习模型。在本文中,我们将 recently introduced 的数据标签(data taggants)方法适配到音频数据中。数据标签是一种方法,用于在仅能访问模型 top-kk 预测的条件下,验证神经网络是否在受保护的图像数据集上训练。该方法依赖于一种定向数据投毒方案,通过隐秘地改变数据集的一小部分(1%)来在分布外数据上诱导一种称为键(keys)的无害行为。我们在 Speechcommands 和 ESC50 数据集以及最先进的 transformer 模型上评估了我们的方法,并表明可以在不损失性能的情况下以高置信度检测数据集的使用。我们还展示了该方法对常见数据增强技术的鲁棒性,使其成为一种保护音频数据集的实用方法。

关键词

引用

@article{arxiv.2503.10269,
  title  = {Targeted Data Poisoning for Black-Box Audio Datasets Ownership Verification},
  author = {Wassim Bouaziz and El-Mahdi El-Mhamdi and Nicolas Usunier},
  journal= {arXiv preprint arXiv:2503.10269},
  year   = {2025}
}

备注

Published at ICASSP 2025, 5 pages, 7 figures