CAM++:一种基于上下文感知掩码的快速高效说话人确认网络
声音
2023-06-19 v3 音频与语音处理
摘要
时延神经网络(TDNN)已被证明对说话人确认十分高效。其成功变体之一 ECAPA-TDNN 以高得多的计算复杂度和较慢的推理速度为代价实现了最先进的性能。这使其难以满足对推理速率要求高且计算资源受限的场景。因此我们致力于寻找一种既能达到 ECAPA-TDNN 性能、又具备原始 TDNN 效率的架构。本文提出一种基于上下文感知掩码的高效网络,即 CAM++,其使用密集连接时延神经网络(D-TDNN)作为骨干,并采用一种新颖的多粒度池化来捕获不同层次的上下文信息。在两个公开基准 VoxCeleb 和 CN-Celeb 上的大量实验表明,所提架构以更低的计算成本和更快的推理速度优于其他主流说话人确认系统。
引用
@article{arxiv.2303.00332,
title = {CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking},
author = {Hui Wang and Siqi Zheng and Yafeng Chen and Luyao Cheng and Qian Chen},
journal= {arXiv preprint arXiv:2303.00332},
year = {2023}
}