中文

基于中文数字串语料的文本相关说话人验证应用框架

声音 2023-12-05 v1 音频与语音处理

摘要

研究指出,在短语音场景下,文本相关说话人验证(TD-SV)通常优于文本无关验证(TI-SV)。然而,收集大规模固定文本语音数据具有挑战性,且随着语音长度增加,句子节奏和停顿等因素影响TD-SV对文本序列的敏感性。基于这些因素,我们提出假设:在时间尺度上更细粒度的池化方法以及语音说话人嵌入与文本嵌入的解耦表示等策略更适合TD-SV。我们引入了一个基于包含较长中文数字串文本的数据集的端到端TD-SV系统。它包含文本嵌入网络、说话人嵌入网络和后端的融合。首先,我们录制了一个名为SHAL的由长中文数字文本组成的数据集,该数据集在Open-SLR网站上公开可用。我们通过使用Tacotron2和HiFi-GAN进行增强来解决数据集稀缺问题。接下来,我们引入了带有文本嵌入和说话人嵌入的语音双表示。在文本嵌入网络中,我们采用了增强的Transformer,并引入了包含文本分类损失、CTC损失和解码器损失的三重损失。对于说话人嵌入网络,我们增强了滑动窗口注意力统计池化(SWASP),结合注意力统计池化(ASP)创建多尺度池化方法。最后,我们融合了文本嵌入和说话人嵌入。我们的池化方法在Hi-Mia和SHAL上分别实现了49.2%和75.0%的等错误率(EER)性能提升。

关键词

引用

@article{arxiv.2312.01645,
  title  = {A text-dependent speaker verification application framework based on Chinese numerical string corpus},
  author = {Litong Zheng and Feng Hong and Weijie Xu},
  journal= {arXiv preprint arXiv:2312.01645},
  year   = {2023}
}