中文

PF-Net:基于原始波形的个性化滤波器说话人识别

音频与语音处理 2022-06-22 v2 声音

摘要

使用 i-vector 的说话人识别已被使用深度学习的说话人识别所取代。基于卷积神经网络(CNNs)的说话人识别近年来被广泛使用,其从原始波形中学习低层语音表示。在此基础上,一种称为 SincNet 的 CNN 架构提出了一种独特的卷积层,实现了带通滤波器。与标准 CNN 相比,SincNet 学习每个滤波器的低截止与高截止频率。本文提出一种称为 PF-Net 的改进 CNN 架构,其促使第一卷积层实现比 SincNet 更具个性化的滤波器。PF-Net 对频域形状进行参数化,并可通过学习频域中的一些形变点来实现带通滤波器。与标准 CNN 相比,PF-Net 能学习每个滤波器的特征。与 SincNet 相比,PF-Net 能学习更多特征参数,而非仅低和高截止频率。这为不同任务提供了个性化滤波器组。实验结果表明,PF-Net 比标准 CNN 收敛更快,且性能优于 SincNet。我们的代码可在 github.com/TAN-OpenLab/PF-NET 获取。

关键词

引用

@article{arxiv.2105.14826,
  title  = {PF-Net: Personalized Filter for Speaker Recognition from Raw Waveform},
  author = {Wencheng Li and Zhenhua Tan and Jingyu Ning and Zhenche Xia and Danke Wu},
  journal= {arXiv preprint arXiv:2105.14826},
  year   = {2022}
}