中文

PosCUDA:面向不可学习音频数据的基于位置的卷积方法

声音 2024-01-05 v1 密码学与安全 机器学习 音频与语音处理

摘要

深度学习模型需要大量干净数据才能获得良好的性能。为避免昂贵的数据获取成本,研究人员使用互联网上丰富的可用数据。这引发了对未经授权将个人数据用于模型训练可能被滥用的重大隐私担忧。近期的研究(如 CUDA)提出了解决此问题的方案,通过添加类别级模糊来使数据集变得不可学习,即模型永远无法使用获取的数据集进行学习。然而,这些方法通常会降低数据质量,使其在实际应用中毫无用处。我们引入了 PosCUDA,一种用于创建不可学习音频数据的基于位置的卷积方法。PosCUDA 在音频的小块上使用类别级卷积。这些小块的位置基于每个类别的私钥,因此模型会学习位置模糊与标签之间的关系,但无法泛化。我们通过实验证明,PosCUDA 能够在保持原始音频数据集质量的同时实现不可学习性。我们提出的方法对不同的音频特征表示(如 MFCC、原始音频)以及不同的架构(如 Transformer、卷积网络等)也具有鲁棒性。

关键词

引用

@article{arxiv.2401.02135,
  title  = {PosCUDA: Position based Convolution for Unlearnable Audio Datasets},
  author = {Vignesh Gokul and Shlomo Dubnov},
  journal= {arXiv preprint arXiv:2401.02135},
  year   = {2024}
}