边缘端的副语言隐私保护
计算与语言
2022-10-03 v3
摘要
语音用户界面和数字助手正迅速进入我们的生活,并成为跨越我们设备的单一接触点。这些始终在线的服务捕获并将我们的音频数据传输到强大的云服务以进行进一步处理和后续操作。通过这些设备收集的声音和原始音频信号包含大量敏感的副语言信息,无论是有意触发还是误触发,这些信息都会被传输给服务提供商。由于我们的情感模式和身份、性别、健康状况等敏感属性很容易被深度声学模型推断出来,使用这些服务使我们面临新一代的隐私风险。缓解基于副语言的隐私泄露风险的一种方法是,在传输语音数据之前,将基于云的处理与在设备端进行的隐私保护型副语言信息学习与过滤相结合。在本文中,我们介绍了 EDGY,一个可配置、轻量级的解耦表示学习框架,它在卸载到云之前于边缘端转换并过滤高维语音数据,以识别并控制敏感属性。我们评估了 EDGY 在设备端的性能,并探索了包括模型量化和知识蒸馏在内的优化技术,以在资源受限设备上实现私密、准确且高效的表示学习。我们的结果表明,在使用 CPU 和单核 ARM 处理器且无专用硬件的情况下,EDGY 在数十毫秒内运行,在从原始语音信号学习语言表示时,“零样本”ABX 分数相对提升 0.2%,或词错误率(WER)的最小性能损失约为 5.95%。
引用
@article{arxiv.2011.02930,
title = {Paralinguistic Privacy Protection at the Edge},
author = {Ranya Aloufi and Hamed Haddadi and David Boyle},
journal= {arXiv preprint arXiv:2011.02930},
year = {2022}
}
备注
14 pages, 7 figures, Accepted at ACM Transactions on Privacy and Security