中文

DS-TDNN:具有全局感知滤波器双流时延神经网络用于说话人验证

声音 2023-08-02 v3 人工智能 音频与语音处理

摘要

传统的时延神经网络(TDNNs)难以处理长程上下文,因此在长语音中其表示说话人信息的能力受限。现有方案要么依赖增加模型复杂度,要么试图在局部特征与全局上下文之间取得平衡以解决此问题。为有效利用音频信号的长时依赖并约束模型复杂度,我们在本工作中引入了一种称为全局感知滤波器层(GF 层)的新模块,该模块在 1D 离散傅里叶变换与其逆变换之间使用一组可学习的变换域滤波器来捕获全局上下文。此外,我们开发了动态滤波策略和稀疏正则化方法以增强 GF 层的性能并防止过拟合。基于 GF 层,我们提出了一种称为 DS-TDNN 的双流 TDNN 架构用于自动说话人验证(ASV),其利用两个独特分支并行提取局部与全局特征,并采用高效策略融合不同尺度信息。在 Voxceleb 和 SITW 数据库上的实验表明,DS-TDNN 在说话人验证任务上相较 ECAPA-TDNN 取得了 10% 的相对提升,同时计算成本相对下降 20%。随着语音时长的增长,该提升将更为明显。此外,DS-TDNN 在任意长度语音上也击败了流行的深度残差模型和基于注意力的系统。

关键词

引用

@article{arxiv.2303.11020,
  title  = {DS-TDNN: Dual-stream Time-delay Neural Network with Global-aware Filter for Speaker Verification},
  author = {Yangfu Li and Jiapan Gan and Xiaodan Lin},
  journal= {arXiv preprint arXiv:2303.11020},
  year   = {2023}
}

备注

13 pages 4 figures