无需单独说话人嵌入模型的个性化语音增强
声音
2024-06-17 v1 人工智能
机器学习
音频与语音处理
摘要
个性化语音增强(PSE)模型可通过适应说话人声音特征来提高语音会议系统的音频质量。然而,大多数现有方法需要单独的说话人嵌入模型从注册音频中提取说话人表示向量,这增加了训练和部署过程的复杂性。我们提议将 PSE 模型本身的内部表示作为说话人嵌入,从而避免单独模型的需求。我们表明该方法在噪声抑制和回声消除任务上与标准方法(使用预训练说话人嵌入模型)等价或更优。此外,我们的方法在 Mean Opinion Score 上比 ICASSP 2023 深度噪声抑制挑战赛获奖者高出 0.15。
引用
@article{arxiv.2406.09928,
title = {Personalized Speech Enhancement Without a Separate Speaker Embedding Model},
author = {Tanel Pärnamaa and Ando Saabas},
journal= {arXiv preprint arXiv:2406.09928},
year = {2024}
}
备注
Accepted to Interspeech 2024