中文

通过说话人互惠点与负样本进行快速调优以提升开放集说话人识别

音频与语音处理 2024-09-25 v1 声音

摘要

本文提出一种新型框架,用于家庭环境中的开放式说话人识别,旨在促进无缝的人机交互。针对当前说话人模型和分类方法的局限性,我们的方法将预训练的 WavLM 前端与few-shot 快速调优神经网络后端相结合,用于注册,采用任务优化的说话人互惠点学习(SRPL)以增强跨多个目标说话人的判别能力。此外,我们提出了改进版 SRPL(SRPL+),集成了来自语音合成负样本和真实负样本的负样本学习,显著提升开放集说话人识别准确率。我们的方法在各种多语言文本依赖说话人识别数据集上进行了彻底评估,展示了其在复杂家庭多说话人识别场景中实现高可用性的效果。该系统相较于直接使用高效 WavLM base+ 模型,在开放集性能上提升了最高 27%。

关键词

引用

@article{arxiv.2409.15742,
  title  = {Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample},
  author = {Zhiyong Chen and Zhiqi Ai and Xinnuo Li and Shugong Xu},
  journal= {arXiv preprint arXiv:2409.15742},
  year   = {2024}
}

备注

IEEE Spoken Language Technology Workshop 2024