中文

利用全局上下文引导的通道与时频变换进行说话人表征学习

音频与语音处理 2020-09-10 v2 机器学习 信号处理

摘要

在本研究中,我们提出全局上下文引导的通道与时频变换,以建模说话人表征中的长程、非局部时频依赖与通道差异。我们利用全局上下文信息,通过计算全局上下文与局部特征间的相似性,来增强重要通道并重新校准显著的时频位置。所提模块与一种流行的基于ResNet的模型一起在VoxCeleb1数据集上进行了评估,该数据集是一个大规模、真实场景下采集的说话人验证语料库。这一轻量级模块可轻松嵌入CNN模型且几乎不增加额外计算开销,并相较基线ResNet-LDE模型与Squeeze&Excitation模块大幅提升了说话人验证性能。我们还进行了详细的消融研究以分析可能影响所提模块性能的各种因素。我们发现,采用所提L2-tf-GTFC变换模块后,等错误率从4.56%降至3.07%,相对降低32.68%,且DCF分数相对提升27.28%。结果表明,我们提出的全局上下文引导变换模块可通过实现时频与通道维度的特征重校准来有效改进所学说话人表征。

关键词

引用

@article{arxiv.2009.00768,
  title  = {Speaker Representation Learning using Global Context Guided Channel and Time-Frequency Transformations},
  author = {Wei Xia and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2009.00768},
  year   = {2020}
}

备注

Accepted to Interspeech 2020