IO-RAE:面向音频隐私保护的信息混淆可逆对抗样本
声音
2026-01-06 v1 密码学与安全
多媒体
音频与语音处理
摘要
人工智能的快速发展显著加速了语音识别技术的普及,使其广泛应用于各类场景。然而,这种应用增长也凸显了一个关键问题:音频数据高度易受未授权公开和分析,为企业和个人构成重大隐私风险。本文引入信息混淆可逆对抗样本(IO-RAE)框架,作为首个旨在保护音频隐私的可逆对抗样本方法。IO-RAE 利用大型语言模型生成具有误导性且语境连贯的内容,有效防止人类和自动语音识别(ASR)系统的未授权窃听。此外,我们提出累积信号攻击技术,通过针对低频信号来缓解高频噪声并提升攻击效能。我们的做法在不降低音频质量或削弱还原能力的前提下,确保了音频数据的保护。实验评估表明,我们方法的优越性体现在:针对多个 ASR 模型(包括来自 Google 的商业黑箱系统)的目标误导率达 96.5%,非目标误导率达 100%;感知语音质量评分(PESQ)达 4.45,相当于高质量原录音;经 ASR 系统处理的恢复音频错误率为 0%,表明近乎无损恢复。这些结果凸显了 IO-RAE 框架在保护敏感音频隐私方面的实用性和有效性。
引用
@article{arxiv.2601.01239,
title = {IO-RAE: Information-Obfuscation Reversible Adversarial Example for Audio Privacy Protection},
author = {Jiajie Zhu and Xia Du and Xiaoyuan Liu and Jizhe Zhou and Qizhen Xu and Zheng Lin and Chi-Man Pun},
journal= {arXiv preprint arXiv:2601.01239},
year = {2026}
}
备注
10 pages, 5 figures