中文

通过小型基础模型在边缘语音理解中保障隐私

音频与语音处理 2025-12-02 v2 机器学习 声音

摘要

强大的语音识别系统依赖云服务提供商进行推理。需要确保不可信的提供商无法推断出语音中的敏感内容。对语音内容进行消毒,需考虑其必须兼顾转录准确性。首次我们利用小型语音基础模型(FM)的未被充分利用的能力,提出了一种新颖用途:增强资源受限设备上的语音隐私。我们引入SpeechShield,一个能够在不损害转录准确性的前提下过滤敏感实体的边缘/云隐私保护语音推理引擎。我们利用基于时间戳的设备端掩码方法,该方法利用令牌到实体预测模型来过滤敏感实体。我们的掩码策略 strategically 隐藏输入的某些部分并隐藏敏感数据。被掩码的输入被发送到可信云服务或本地中枢以生成掩码后的输出。SpeechShield的有效性取决于实体时间段的掩码方式如何得当。我们的恢复方案是一种基于置信得分的方法,在云端和设备端模型之间选择最佳预测。我们在64位Raspberry Pi 4B上实现了SpeechShield。实验表明,我们的解决方案在不牺牲隐私的前提下实现了稳健的语音识别。SpeechShield在<100 MB内存下,实现了达到业界先进水平(SOTA)的语音转录性能,同时直接在设备端过滤约83%的私有实体。SpeechShield在内存上仅为现有隐私保护语音框架的16倍,速度快3.3倍,计算效率提高17倍,相较于现有的离线转录服务,其词错误率(WER)相对降低38.8-77.5%。

关键词

引用

@article{arxiv.2502.01649,
  title  = {Safeguarding Privacy in Edge Speech Understanding with Tiny Foundation Models},
  author = {Afsara Benazir and Felix Xiaozhu Lin},
  journal= {arXiv preprint arXiv:2502.01649},
  year   = {2025}
}