PCF:采用渐进通道融合的 ECAPA-TDNN 说话人验证模型
声音
2023-03-02 v1 音频与语音处理
摘要
ECAPA-TDNN 是当前最流行的用于说话人验证的 TDNN 系列模型,刷新了 TDNN 模型的最先进(SOTA)性能。然而,一维卷积在特征通道上具有全局感受野,破坏了频谱图的时频相关性。此外,由于 ECAPA-TDNN 仅含五层,相较于 ResNet 结构浅得多,限制了生成深层表征的能力。为进一步提升 ECAPA-TDNN,我们提出一种渐进通道融合策略,沿特征通道分割频谱图并通过网络逐步扩展感受野。其次,我们通过增加深度与添加分支来扩大模型。我们所提模型在 vox1o 上取得 0.718 的 EER 与 0.0858 的 minDCF(0.01),相较 ECAPA-TDNN-large 分别相对提升 16.1% 与 19.5%。
引用
@article{arxiv.2303.00204,
title = {PCF: ECAPA-TDNN with Progressive Channel Fusion for Speaker Verification},
author = {Zhenduo Zhao and Zhuo Li and Wenchao Wang and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2303.00204},
year = {2023}
}
备注
Accepted by ICASSP 2023