中文

低频语音信号的隐私性: resampling 方法、评估情景与说话人特征

机器学习 2025-08-05 v1

摘要

虽然现实生活中的音频录音提供了关于社交动态和对话行为的见解,但也引发了对个人敏感数据的隐私 concerns。本文探讨了将录音限制在低频音频以保护说话内容的有效性。对于对音频信号进行不同的 resampling,我们比较了采用防混叠滤波的效果。通过增加自动语音识别模型的词错误率来衡量隐私增强。通过语音活动检测模型来衡量实用性能的影响。我们的实验结果表明,对于干净的录音,训练采样率最高可达 800 Hz 时,自动语音识别模型仍能正确 transcribe 大多数单词。对于两个模型,我们分析了说话人性别和音高的影响,我们证明了缺乏防混叠滤波更显著地损害语音隐私。

关键词

引用

@article{arxiv.2508.02482,
  title  = {Toward Using Machine Learning as a Shape Quality Metric for Liver Point Cloud Generation},
  author = {Khoa Tuan Nguyen and Gaeun Oh and Ho-min Park and Francesca Tozzi and Wouter Willaert and Joris Vankerschaver and Niki Rashidian and Wesley De Neve},
  journal= {arXiv preprint arXiv:2508.02482},
  year   = {2025}
}