中文

无坍塌的私有语音分类:稳定的 DP 训练与离线蒸馏

声音 2026-05-05 v1 多媒体

摘要

我们研究在实际释放约束下进行的基于样本的私有监督语音分类:训练时可访问受限方面信息,但发布的模型必须为音频唯一。此设置重要,因为语音系统在开发时常能利用更丰富的方面信息,而部署和发布则需要轻量级单模态模型以保证可审计的隐私。使用在私有数据集 DprivD_{\text{priv}} 上的 DP-SGD,我们识别出一种强隐私失效模式(ϵ1\epsilon \le 1),在不平衡任务中训练可能坍缩为接近单类预测器,而整体准确率可能掩盖这一现象。因此我们强调宏平均F1、平衡准确率以及一种简单的坍缩诊断。此失效在我们的释放设置中尤其有问题,因为坍缩的私有教师无法为下游音频唯一学生提供有用的监督。为解决此设置下的强隐私问题,我们提出了一个两阶段协议:(i)在 DprivD_{\text{priv}} 上训练一个(可能是多模态的)DP 教师,(ii)在固定的录音不相交的辅助数据集 DauxD_{\text{aux}} 上进行离线蒸馏,仅释放学生。DP 保证仅适用于 DprivD_{\text{priv}};我们对 DauxD_{\text{aux}} 不作 DP 主张,学生相对于 DprivD_{\text{priv}} 的隐私通过后处理得以保证。我们将此设置定义为涉及四个耦合瓶颈:DP-SGD 下的语音引起的优化不稳定、裁剪和噪声下的少数类侵蚀、教师对在部署时不可用的特权模态的过度依赖,以及训练-部署模态不匹配。我们通过 DP 稳定声学前端(DSAF)、小批量自适应有界损失重加权(AW-DP)、特权模态丢弃以及离线教师-学生蒸馏来解决这些问题。

关键词

引用

@article{arxiv.2605.02718,
  title  = {Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation},
  author = {Yadi Wen and Tianxin Li and Enji Liang and Rong Du and Yue Fu},
  journal= {arXiv preprint arXiv:2605.02718},
  year   = {2026}
}