中文

分解式时间动态CNN:用于文本无关说话人验证的高效时间自适应网络及其说话人激活图解析

音频与语音处理 2022-10-28 v2 声音

摘要

为在文本无关说话人验证中提取准确的说话人信息,提出了将卷积核自适应到每个时间片段的时间动态CNN(TDY-CNN)。然而,TDY-CNN的模型规模过大且自适应卷积核的自由度有限。为解决这些局限,我们提出分解式时间动态CNN(DTDY-CNN),其基于矩阵分解将静态卷积核与动态残差相结合以构成时间自适应卷积核。所提出的DTDY-ResNet-34(x0.50)在不使用数据增强且采用注意力统计池化的情况下取得了0.96%的等错误率(EER),优于其他最先进方法。DTDY-CNN是TDY-CNN的成功升级,将模型规模减少了64%并提升了性能。我们表明,与TDY-CNN相比,DTDY-CNN还能提取更准确的帧级说话人嵌入。使用针对说话人验证改进的梯度加权类激活映射(Grad-CAM)生成的说话人激活图(SAM),分析了DTDY-ResNet-34(x0.50)在提取说话人信息时的详细行为。DTDY-ResNet-34(x0.50)不仅能从共振峰频率,还能从无声音素的低频信息中有效提取说话人信息,从而解释了其在文本无关说话人验证上的出色表现。

关键词

引用

@article{arxiv.2203.15277,
  title  = {Decomposed Temporal Dynamic CNN: Efficient Time-Adaptive Network for Text-Independent Speaker Verification Explained with Speaker Activation Map},
  author = {Seong-Hu Kim and Hyeonuk Nam and Yong-Hwa Park},
  journal= {arXiv preprint arXiv:2203.15277},
  year   = {2022}
}

备注

Submitted to ICASSP 2023