中文

MGFF-TDNN:一种用于说话人验证的、带深度可分离模块的多粒度特征融合TDNN模型

声音 2025-05-07 v1 音频与语音处理

摘要

在说话人验证中,传统模型通常侧重于对长时上下文特征进行建模,以捕捉全局说话人特性。然而,这种方法可能忽略细粒度声纹信息,而这些信息包含对鲁棒说话人嵌入至关重要的高判别性特征。本文提出了一种新颖的模型架构,称为MGFF-TDNN,它基于多粒度特征融合。MGFF-TDNN利用一个增强了局部特征建模能力的二维深度可分离卷积模块作为前端特征提取器,以有效捕捉时频域特征。为实现全面的多粒度特征融合,我们提出了M-TDNN结构,该结构通过结合时延神经网络和音素级特征池化,将全局上下文建模与细粒度特征提取相集成。在VoxCeleb数据集上的实验表明,MGFF-TDNN在说话人验证中取得了卓越的性能,同时在参数和计算资源方面保持高效。

关键词

引用

@article{arxiv.2505.03228,
  title  = {MGFF-TDNN: A Multi-Granularity Feature Fusion TDNN Model with Depth-Wise Separable Module for Speaker Verification},
  author = {Ya Li and Bin Zhou and Bo Hu},
  journal= {arXiv preprint arXiv:2505.03228},
  year   = {2025}
}