中文

RawNeXt:基于深度层聚合与扩展动态缩放策略的变时长语句说话人验证系统

音频与语音处理 2022-06-28 v2

摘要

尽管使用深度神经网络在说话人验证中取得了令人满意的性能,变时长语句仍是威胁系统鲁棒性的一项挑战。为应对此问题,我们提出了一种称为 RawNeXt 的说话人验证系统,其通过采用以下两个组件来处理任意长度的输入原始波形:(1) 深度层聚合策略通过迭代且分层地聚合各块输出的不同时间尺度与频谱通道特征来增强说话人信息。(2) 扩展动态缩放策略通过在每个块中选择性合并不同分辨率分支的激活值,依据语句长度灵活处理特征。得益于这两个组件,我们所提模型能够提取富含时频信息的说话人嵌入,并动态应对长度变化。在由不同时长语句组成的 VoxCeleb1 测试集上的实验结果表明,与近期提出的系统相比,RawNeXt 取得了最先进的性能。我们的代码与训练模型权重可在 https://github.com/wngh1187/RawNeXt 获取。

关键词

引用

@article{arxiv.2112.07935,
  title  = {RawNeXt: Speaker verification system for variable-duration utterances with deep layer aggregation and extended dynamic scaling policies},
  author = {Ju-ho Kim and Hye-jin Shim and Jungwoo Heo and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:2112.07935},
  year   = {2022}
}

备注

5 pages, 2 figures, 4 tables, accepted to 2022 ICASSP as a conference paper