中文

WavShape:面向公平性和隐私敏感的音频处理的信息论语音表示学习

声音 2025-10-09 v1 人工智能 音频与语音处理

摘要

语音嵌入往往保留受访者身份、方言或人口统计信息等敏感属性, 这会在偏差模型训练和隐私泄露方面造成风险。我们提出了 WavShape, 一个信息论语音表示学习框架, 用于在保持面向下游任务的必要信息的同时, 对嵌入进行公平性和隐私优化。我们利用 Donsker-Varadhan 公式进行信息散度(MI)估计, 从而指导一个基于 MI 的编码器, 系统性地过滤敏感属性, 同时保持语音内容对下游任务的必要信息。在三个已知数据集上的实验结果表明, WavShape 可将嵌入与敏感属性之间的 MI 降低最高可达 81%, 同时保留 97% 的任务相关信息。通过将信息论与自监督语音模型集成, 本工作推动了公平、隐私感知且资源高效语音系统的发展。

关键词

引用

@article{arxiv.2506.22789,
  title  = {WavShape: Information-Theoretic Speech Representation Learning for Fair and Privacy-Aware Audio Processing},
  author = {Oguzhan Baser and Ahmet Ege Tanriverdi and Kaan Kale and Sandeep P. Chinchali and Sriram Vishwanath},
  journal= {arXiv preprint arXiv:2506.22789},
  year   = {2025}
}

备注

5 pages, 4 figures, Published at The Proceedings of Interspeech 2025, code is available at http://www.github.com/UTAustin-SwarmLab/WavShape