中文

适用于增强情感保持的通用解缝式说话人匿名化

声音 2025-04-24 v2 音频与语音处理

摘要

通用解缝式说话人匿名化系统通常使用各自的编码器将语音分离为内容、说话人和韵律特征。本文探讨了如何调整该系统以便更好地保留新的语音属性,例如情感。虽然现有系统在匿名化说话人嵌入方面表现良好,但未针对情感保留进行设计。本文检验了两种策略。首先,我们展示了将来自预训练情感编码器的情感嵌入整合进系统可帮助保留情感线索,尽管这会稍微损害隐私保护。或者,我们提出了一种情感补偿策略作为应用于匿名化说话人嵌入的后处理步骤。该方法既隐藏原始说话人的身份,又重新引入在说话人嵌入匿名化过程中丢失的情感特征。具体而言,我们使用支持向量机(SVM)来建模情感属性,为每种情感学习独立的边界。在推断期间,原始说话人嵌入被处理两种方式:一种是通过情感指示器预测情感并准确选择匹配的 SVM;另一种是通过说话人匿名化器隐藏说话人特征。随后,对匿名化的说话人嵌入沿相应 SVM 边界向增强情感方向进行修改,以保存情感线索。所提出的策略也预计对调整通用解缝式说话人匿名化系统以保留其他目标旁语言属性具有用途,潜在可用于各种下游任务。

关键词

引用

@article{arxiv.2408.05928,
  title  = {Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation},
  author = {Xiaoxiao Miao and Yuxiang Zhang and Xin Wang and Natalia Tomashenko and Donny Cheng Lock Soh and Ian Mcloughlin},
  journal= {arXiv preprint arXiv:2408.05928},
  year   = {2025}
}

备注

Accepted by computer speech and language