中文

DT-SV:一种基于Transformer的时域说话人确认方法

声音 2022-05-27 v1 机器学习 音频与语音处理

摘要

说话人确认(SV)旨在判断测试语音的说话人身份是否与参考语音相同。过去几年,利用深度神经网络提取说话人嵌入用于SV系统已成为主流。近来,不同的注意力机制和Transformer网络在SV领域被广泛探索。然而,直接将原始Transformer用于SV可能会在输出特征上造成帧级信息浪费,从而限制说话人嵌入的能力与判别性。因此,我们提出一种通过Transformer架构导出 utterance 级说话人嵌入的方法,其使用一种名为分流损失(diffluence loss)的新损失函数整合不同Transformer层的特征信息。其中,分流损失旨在将帧级特征聚合成 utterance 级表示,并可便捷地集成到Transformer中。此外,我们还引入了名为时域特征提取器的可学习梅尔滤波器组能量特征提取器,其比标准梅尔滤波器组提取器更精确高效地计算梅尔滤波器组特征。结合分流损失与时域特征提取器,我们提出了一种新颖的基于Transformer的时域SV模型(DT-SV),具有更快的训练速度和更高的准确率。实验表明,我们提出的模型相比其他模型能取得更优性能。

关键词

引用

@article{arxiv.2205.13249,
  title  = {DT-SV: A Transformer-based Time-domain Approach for Speaker Verification},
  author = {Nan Zhang and Jianzong Wang and Zhenhou Hong and Chendong Zhao and Xiaoyang Qu and Jing Xiao},
  journal= {arXiv preprint arXiv:2205.13249},
  year   = {2022}
}

备注

Accepted by IJCNN2022 (The 2022 International Joint Conference on Neural Networks)