中文

TitaNet:采用一维深度可分离卷积与全局上下文的说话人表征神经网络模型

音频与语音处理 2021-10-12 v1 声音

摘要

本文提出 TitaNet,一种用于提取说话人表征的新型神经网络架构。我们采用带全局上下文的 Squeeze-and-Excitation(SE)层的一维深度可分离卷积,后接基于通道注意力的统计量池化层,将变长语音映射为定长嵌入(t-vector)。TitaNet 是可扩展架构,在说话人验证任务上取得最先进性能,在 VoxCeleb1 测试集上等错误率(EER)为 0.68%,在说话人日志任务上 AMI-MixHeadset 上日志错误率(DER)为 1.73%、AMI-Lapel 上为 1.99%、CH109 上为 1.11%。此外,我们研究了 TitaNet 的多种规模,并提出仅含 6M 参数的轻量 TitaNet-S 模型,在日志任务上取得接近最先进的结果。

关键词

引用

@article{arxiv.2110.04410,
  title  = {TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context},
  author = {Nithin Rao Koluguri and Taejin Park and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2110.04410},
  year   = {2021}
}

备注

preprint. Submitted to ICASSP 2022