中文

量化近似信号处理 (QASP):面向音频的同态加密

音频与语音处理 2025-05-16 v1 密码学与安全 声音

摘要

音频和语音数据在语音识别、说话人识别和精神健康监测等机器学习应用中日益受到重视。然而,由音频监听设备被动收集此类数据会引发重大的隐私问题。全同态加密 (FHE) 作为一种通过在加密数据上进行计算来保留用户隐私的有前景的解决方案。尽管存在潜力,但以往尝试将 FHE 应用于音频处理的努力面临诸多挑战,尤其是在安全计算时频表示方面,这是许多音频任务中的关键步骤。为此,我们提出了一条全面安全的管道,通过 FHE 和量化神经网络运算,计算四种基本时频表示:短时傅里叶变换 (STFT)、梅尔滤波器组、梅尔频率倒数谱系数 (MFCCs) 以及 gammatone 滤波器。我们的方法还支持音频描述符和卷积神经网络 (CNN) 分类器的私密计算。此外,我们提出了近似 STFT 算法,以降低统计和机器学习分析中的计算量和位数使用。我们在 VocalSet 和 OxVoc 数据集上进行实验,证明了我们方法的完全私密计算。我们展示了在音频标记的私密统计分析中以及以 CNN 进行声带运动分类中,STFT 近似显著改善了性能。我们的结果表明,这些近似在 FHE 中的 STFT 实现错误率显著低于常规实现。我们还展示了基于原始音频的完全私密分类,用于性别和声带运动分类。最后,我们提供了一种实用的参数选择 heuristics,使面向保护敏感音频数据的研究者和实践者的量化近似信号处理变得可及。

关键词

引用

@article{arxiv.2505.10500,
  title  = {Quantized Approximate Signal Processing (QASP): Towards Homomorphic Encryption for audio},
  author = {Tu Duyen Nguyen and Adrien Lesage and Clotilde Cantini and Rachid Riad},
  journal= {arXiv preprint arXiv:2505.10500},
  year   = {2025}
}

备注

34 pages, 5 figures