LightCAM:一种用于说话人验证的基于上下文感知掩码的 D-TDNN 快速轻量级实现
计算与语言
2024-02-13 v2 声音
音频与语音处理
摘要
传统的时延神经网络(TDNN)以高计算复杂度和较慢的推理速度为代价实现了最先进(SOTA)的性能,使其难以在工业环境中部署。具有上下文感知掩码(CAM)模块的密集连接时延神经网络(D-TDNN)已被证明是一种在保持系统性能的同时降低复杂度的高效结构。在本文中,我们提出了一种快速轻量级模型 LightCAM,该模型进一步采用了深度可分离卷积模块(DSM),并使用多尺度特征聚合(MFA)在不同层级进行特征融合。我们在 VoxCeleb 数据集上进行了大量实验,对比结果显示,其在 VoxCeleb1-O 上取得了 0.83 的等错误率(EER)和 0.0891 的最小检测成本函数(MinDCF),优于其他主流说话人验证方法。此外,复杂度分析进一步表明,所提出的架构具有更低的计算成本和更快的推理速度。
引用
@article{arxiv.2402.06073,
title = {LightCAM: A Fast and Light Implementation of Context-Aware Masking based D-TDNN for Speaker Verification},
author = {Di Cao and Xianchen Wang and Junfeng Zhou and Jiakai Zhang and Yanjing Lei and Wenpeng Chen},
journal= {arXiv preprint arXiv:2402.06073},
year = {2024}
}