中文

基于说话人-文本分解嵌入的说话人验证文本适配

音频与语音处理 2025-08-07 v1 声音

摘要

预收集的数据(训练数据或注册数据)与实际测试数据之间的文本不匹配现象会显著损害文本依赖型说话人验证(SV)系统性能。虽然可通过精心收集具有目标语音内容的数据来解决此问题,但这种数据收集成本高昂且灵活性差。本文提出一种新型文本适配框架以解决文本不匹配问题。我们提出一种说话人-文本分解网络,将输入语音分解为说话人嵌入和文本嵌入,然后在后续阶段将其整合为单一表示。给定少量与说话人无关的适应语音后,可提取目标语音内容的文本嵌入,用于将文本无关的说话人嵌入适配为文本定制化的说话人嵌入。在RSR2015数据集上进行实验表明,文本适配显著改善了文本不匹配情况下的系统性能。

关键词

引用

@article{arxiv.2508.04425,
  title  = {Text adaptation for speaker verification with speaker-text factorized embeddings},
  author = {Yexin Yang and Shuai Wang and Xun Gong and Yanmin Qian and Kai Yu},
  journal= {arXiv preprint arXiv:2508.04425},
  year   = {2025}
}

备注

ICASSP 2020