RSKNet-MTSP:高效且可移植的说话人验证深度架构
声音
2021-08-31 v1 音频与语音处理
摘要
基于卷积神经网络(CNN)的方法在说话人验证(SV)任务中取得了巨大成功,其中对长时上下文建模与减少说话人特征的信息损失是显著影响验证性能的两个重要挑战。已有工作引入空洞卷积与多尺度聚合方法来应对上述挑战。然而,此类方法仍难以充分利用一些有价值的信息,从而难以实质性提升验证性能。为解决上述问题,我们构建了名为RSKNet-MTSP的新型基于CNN的SV架构,其中首次提出了残差选择性核块(RSKBlock)与多时间尺度统计池化(MTSP)模块。RSKNet-MTSP能够同时捕获长时上下文与邻域信息,并从多尺度特征中聚集更多具有说话人判别性的信息。为针对资源受限的实际应用设计可移植模型,我们进而给出了RSKNet-MTSP的轻量版本,即RSKNet-MTSP-L,其采用将深度可分离卷积与权值矩阵低秩分解相结合的技朮。我们在两个公开SV数据集VoxCeleb和Speaker in the Wild(SITW)上进行了充分实验。结果表明:1)RSKNet-MTSP在所有测试集上以至少9%–26%的优势超越SOTA深度嵌入架构;2)RSKNet-MTSP-L相比基线模型以少17%–39%的网络参数取得了具竞争力的性能。消融实验进一步说明我们提出的方法相对先前方法取得了实质性改进。
引用
@article{arxiv.2108.13249,
title = {RSKNet-MTSP: Effective and Portable Deep Architecture for Speaker Verification},
author = {Yanfeng Wu and Chenkai Guo and Junan Zhao and Xiao Jin and Jing Xu},
journal= {arXiv preprint arXiv:2108.13249},
year = {2021}
}
备注
submitted to Neurocomputing