通过分段波形反转实现环境声录音中语音内容的隐私保护
声音
2025-07-14 v1 音频与语音处理
摘要
环境声录音常包含可理解的语音,引发隐私 concerns,限制了数据的分析、共享和重用。在本文中,我们引入一种方法,使语音难以理解,同时保持声学场景的完整性和整体音频质量。我们的做法是反转语音片段的波形,以扰乱语音内容。通过语音活动检测和语音分离管道增强这一过程,使我们能够更精确地针对语音。为Demonstrate该方法的有效性,我们考虑一个三部分评估方案,评估:1) 使用词错误率 (WER) 的语音可理解性,2) 使用声源分类准确度下降 (SCAD) 从广泛使用的预训练模型检测声源,3) 使用弗里谢音频距离 (FAD) 的音频质量,其中使用包含未受扰语音的参考数据集。本实验在该模拟评估数据集上进行,该数据集由语音和环境声场景的线性混合物组成,表明我们的方法实现了令人满意的语音可理解性降低(97.9% WER),声源检测的最小退化(2.7% SCAD),以及高感知质量(FAD 为 1.40)。消融研究进一步突显了管道各组件的贡献。我们还表明,将随机拼接纳入语音内容隐私保护方法后,可在尝试恢复干净语音时增强算法的鲁棒性,但以轻微的音频质量代价为代价。
引用
@article{arxiv.2507.08412,
title = {Enforcing Speech Content Privacy in Environmental Sound Recordings using Segment-wise Waveform Reversal},
author = {Modan Tailleur and Mathieu Lagrange and Pierre Aumond and Vincent Tourre},
journal= {arXiv preprint arXiv:2507.08412},
year = {2025}
}