中文

EASY:基于因子化蒸馏的情感感知说话人匿名化

音频与语音处理 2025-06-02 v2 声音

摘要

情感在语音交互中发挥着重要作用,通过语调、音高和节奏传递,超越文字表达情感和意图,创造更个性化的体验。然而,大多数现有说话人匿名化系统采用并行解缠方法,仅将语音分解为语言内容和说话人身份,往往忽略保留原始情感状态的保护。在本研究中,我们引入EASY,一种情感感知说话人匿名化框架。EASY采用新颖的顺序解缠过程,将说话人身份、语言内容和情感表示分离,通过因子化蒸馏方法在不同的子空间中建模每个语音属性。通过独立约束说话人身份和情感表示,EASY最小化信息泄露,增强隐私保护,同时保持原始语言内容和情感状态。在VoicePrivacy Challenge官方数据集上的实验结果表明,我们提出的方法优于所有基线系统,有效保护说话人隐私,同时保持语言内容和情感状态。

关键词

引用

@article{arxiv.2505.15004,
  title  = {EASY: Emotion-aware Speaker Anonymization via Factorized Distillation},
  author = {Jixun Yao and Hexin Liu and Eng Siong Chng and Lei Xie},
  journal= {arXiv preprint arXiv:2505.15004},
  year   = {2025}
}

备注

Accepted by INTERSPEECH 2025