中文

基于变帧率注意力条件化方法的风格鲁棒说话人验证

音频与语音处理 2022-06-29 v1 机器学习

摘要

我们提出一种提取说话人嵌入的方法,该嵌入在文本无关说话人验证中对说话风格变化具有鲁棒性。通常,说话人嵌入提取包括训练一个用于说话人分类的 DNN,并使用瓶颈特征作为说话人表征。此类网络具有池化层,通过对所有语句帧计算统计量以将帧级特征转换为语句级特征,且权重相等。然而,自注意力嵌入执行加权池化,使权重对应于帧在说话人分类任务中的重要性。熵可捕捉由说话风格变化引起的声学变异性。因此,提出一种基于熵的变帧率向量作为自注意力层的外部条件向量,为网络提供可应对风格效应的信息。本文探索五种不同的条件化方法。最佳条件化方法——带门控的拼接,在使用 UCLA 说话人变异性数据库时,于 23 项任务中的 12 项相较 x-vector 基线取得统计显著改进,并于 11/23 项任务中与基线相同。其在 23 项任务中的 9 项显著优于无条件的自注意力,且仅在 1/23 项中更差。该方法在 SITW 的多说话人场景中也显示出显著改进。

关键词

引用

@article{arxiv.2206.13680,
  title  = {Attention-based conditioning methods using variable frame rate for style-robust speaker verification},
  author = {Amber Afshan and Abeer Alwan},
  journal= {arXiv preprint arXiv:2206.13680},
  year   = {2022}
}

备注

To appear in Interspeech, 2022