利用合成情感语料提升说话人验证鲁棒性
声音
2024-12-03 v1 人工智能
音频与语音处理
摘要
说话人验证(SV)系统提供一种认证服务,用于确认给定的语音样本是否来自特定说话人。该技术为满足个体偏好的各种个性化应用铺平了道路。值得注意的挑战是 SV 系统在不同情感谱系上的一致性能力。大多数现有模型在处理情感语料时错误率较高,尤其是相对于中性语料。因此,这一现象常常导致错失有价值的语音。主要原因是情感语料的标记数据稀缺,阻碍了涵盖多样情感状态的鲁棒说话人表征的开发。为此,我们提出一种新方法,采用 CycleGAN 框架作为数据增强方法。该技术在保留独特语音身份的同时,为每个特定说话人合成情感语音片段。我们的实验结果强调了将合成情感数据纳入训练过程的有效性。使用该增强数据集训练的模型在情感语音场景下验证说话人的任务上 consistently 优于基线模型,使等错误率降低最高可达 3.64%。
引用
@article{arxiv.2412.00319,
title = {Improving speaker verification robustness with synthetic emotional utterances},
author = {Nikhil Kumar Koditala and Chelsea Jui-Ting Ju and Ruirui Li and Minho Jin and Aman Chadha and Andreas Stolcke},
journal= {arXiv preprint arXiv:2412.00319},
year = {2024}
}