通过小型基础模型在边缘语音理解中保障隐私
音频与语音处理
2025-12-02 v2 机器学习
声音
摘要
强大的语音识别系统依赖云服务提供商进行推理。需要确保不可信的提供商无法推断出语音中的敏感内容。对语音内容进行消毒,需考虑其必须兼顾转录准确性。首次我们利用小型语音基础模型(FM)的未被充分利用的能力,提出了一种新颖用途:增强资源受限设备上的语音隐私。我们引入SpeechShield,一个能够在不损害转录准确性的前提下过滤敏感实体的边缘/云隐私保护语音推理引擎。我们利用基于时间戳的设备端掩码方法,该方法利用令牌到实体预测模型来过滤敏感实体。我们的掩码策略 strategically 隐藏输入的某些部分并隐藏敏感数据。被掩码的输入被发送到可信云服务或本地中枢以生成掩码后的输出。SpeechShield的有效性取决于实体时间段的掩码方式如何得当。我们的恢复方案是一种基于置信得分的方法,在云端和设备端模型之间选择最佳预测。我们在64位Raspberry Pi 4B上实现了SpeechShield。实验表明,我们的解决方案在不牺牲隐私的前提下实现了稳健的语音识别。SpeechShield在<100 MB内存下,实现了达到业界先进水平(SOTA)的语音转录性能,同时直接在设备端过滤约83%的私有实体。SpeechShield在内存上仅为现有隐私保护语音框架的16倍,速度快3.3倍,计算效率提高17倍,相较于现有的离线转录服务,其词错误率(WER)相对降低38.8-77.5%。
引用
@article{arxiv.2502.01649,
title = {Safeguarding Privacy in Edge Speech Understanding with Tiny Foundation Models},
author = {Afsara Benazir and Felix Xiaozhu Lin},
journal= {arXiv preprint arXiv:2502.01649},
year = {2025}
}