端到端说话人提取中说话人增强方法研究
声音
2025-05-29 v1 音频与语音处理
摘要
目标混淆(定义为偶尔切换至非目标说话人)是端到端说话人提取(E2E-SE)系统面临的关键挑战。我们认为该问题很大程度上是由说话人嵌入缺乏泛化能力和判别能力所致,并引入一种简单而有效的说话人增强策略来解决该问题。具体而言,我们提出了一种时域重采样与重缩放流程,该流程在保留其他语音属性的同时改变说话人特征。这生成了多种伪说话人,有助于建立具有泛化能力的说话人嵌入空间,而针对特定说话人特征的增强则生成了困难样本,迫使模型关注真正的说话人特征。在 WSJ0-2Mix 和 LibriMix 上的实验表明,我们的方法缓解了目标混淆问题并提升了提取性能。此外,该方法可与度量学习(解决目标混淆的另一种有效方法)相结合,带来进一步的性能提升。
引用
@article{arxiv.2505.21805,
title = {An Investigation on Speaker Augmentation for End-to-End Speaker Extraction},
author = {Zhenghai You and Zhenyu Zhou and Lantian Li and Dong Wang},
journal= {arXiv preprint arXiv:2505.21805},
year = {2025}
}