中文

面向不同语音段时长的通用说话人识别编码器

声音 2022-10-31 v1 机器学习 音频与语音处理

摘要

创建对不同声学和语音时长条件均鲁棒的通用说话人编码器是当今的一大挑战。根据我们的观察,在短语音段上训练的系统对短短语说话人验证最优,而在长段上训练的系统对长段验证更优。同时在池化的短和长语音段上训练的系统不能给出最优的验证结果,且通常在短和长段上均退化。本文致力于解决创建面向不同语音段时长的通用说话人编码器的问题。我们描述了用于训练任意选定神经网络架构的通用说话人编码器的简单方案。根据我们在 NIST SRE 和 VoxCeleb1 基准上获得的基于 wav2vec-TDNN 系统的评估结果,所提出的通用编码器在注册和测试语音段时长不同的情况下提供了说话人验证的提升。所提出编码器的关键特征是它具有与所选神经网络架构相同的推理时间。

关键词

引用

@article{arxiv.2210.16231,
  title  = {Universal speaker recognition encoders for different speech segments duration},
  author = {Sergey Novoselov and Vladimir Volokhov and Galina Lavrentyeva},
  journal= {arXiv preprint arXiv:2210.16231},
  year   = {2022}
}

备注

Submitted to ICASSP'23