无坍塌的私有语音分类:稳定的 DP 训练与离线蒸馏
声音
2026-05-05 v1 多媒体
摘要
我们研究在实际释放约束下进行的基于样本的私有监督语音分类:训练时可访问受限方面信息,但发布的模型必须为音频唯一。此设置重要,因为语音系统在开发时常能利用更丰富的方面信息,而部署和发布则需要轻量级单模态模型以保证可审计的隐私。使用在私有数据集 上的 DP-SGD,我们识别出一种强隐私失效模式(),在不平衡任务中训练可能坍缩为接近单类预测器,而整体准确率可能掩盖这一现象。因此我们强调宏平均F1、平衡准确率以及一种简单的坍缩诊断。此失效在我们的释放设置中尤其有问题,因为坍缩的私有教师无法为下游音频唯一学生提供有用的监督。为解决此设置下的强隐私问题,我们提出了一个两阶段协议:(i)在 上训练一个(可能是多模态的)DP 教师,(ii)在固定的录音不相交的辅助数据集 上进行离线蒸馏,仅释放学生。DP 保证仅适用于 ;我们对 不作 DP 主张,学生相对于 的隐私通过后处理得以保证。我们将此设置定义为涉及四个耦合瓶颈:DP-SGD 下的语音引起的优化不稳定、裁剪和噪声下的少数类侵蚀、教师对在部署时不可用的特权模态的过度依赖,以及训练-部署模态不匹配。我们通过 DP 稳定声学前端(DSAF)、小批量自适应有界损失重加权(AW-DP)、特权模态丢弃以及离线教师-学生蒸馏来解决这些问题。
引用
@article{arxiv.2605.02718,
title = {Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation},
author = {Yadi Wen and Tianxin Li and Enji Liang and Rong Du and Yue Fu},
journal= {arXiv preprint arXiv:2605.02718},
year = {2026}
}