基于可解释性的语音预训练模型说话人解耦
声音
2026-04-02 v3 音频与语音处理
摘要
自监督语音模型学习到的表征同时捕获了内容和说话人信息。然而,这种 entanglement 会导致问题:内容任务受到说话人偏见的影响,隐私问题则在声学身份通过所谓匿名化表征而外泄时出现。我们提出了两个解决方案。首先,我们开发了 InterpTRQE-SptME(基于可解释性对语音预训练模型编码进行声学残余量化评估基准),该基准使用基于 SHAP 的可解释性分析直接测量内容嵌入中残余说话人信息。不同于现有的间接指标,我们的方法在解耦后量化确切的说话人信息比例。其次,我们提出了 InterpTF-SptME,通过这些可解释性洞察来过滤嵌入中的说话人信息。在 VCTK 数据集上测试包括 HuBERT、WavLM 和 ContentVec 在内的七个模型时,我们发现 SHAP 噪声过滤将说话人残留降低至接近零,同时保持识别准确性(CTC 损失增加不到 1%)。该方法具有模型无关性,无需重新训练。
引用
@article{arxiv.2507.17851,
title = {Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability},
author = {Xiaoxu Zhu and Junhua Li and Aaron J. Li and Guangchao Yao and Xiaojie Yu},
journal= {arXiv preprint arXiv:2507.17851},
year = {2026}
}
备注
5 pages, 4 figures