中文

课程式 SincNet:通过强调潜空间中的困难样本实现鲁棒深度说话人识别

音频与语音处理 2023-06-13 v1 机器学习 声音

摘要

深度学习模型已成为生物特征识别系统(如说话人识别)日益优选的选择。SincNet 是一种深度神经网络架构,因其参数化 sinc 函数可直接处理语音信号而在说话人识别任务中广受欢迎。原始 SincNet 架构使用 softmax 损失,这可能不是基于识别任务的最合适选择。此类损失函数既不施加类间间隔,也不区分容易与困难的训练样本。课程学习,尤其是利用基于角间隔损失的课程学习,已在人脸识别等其他生物特征应用中被证明非常成功。此类基于课程学习的技术的优势在于,它将施加类间间隔,并同时考虑容易和困难样本。在本文中,我们提出 Curricular SincNet(CL-SincNet),一种改进的 SincNet 模型,其中我们使用课程损失函数来训练 SincNet 架构。所提模型在多个数据集上使用数据集内与跨数据集评估协议进行了评估。在两种设置下,该模型均与其他已发表的工作具有竞争力。在跨数据集测试的情况下,它取得了最佳总体结果,与 SincNet 及其他已发表工作相比错误率降低了 4%。

关键词

引用

@article{arxiv.2108.10714,
  title  = {Curricular SincNet: Towards Robust Deep Speaker Recognition by Emphasizing Hard Samples in Latent Space},
  author = {Labib Chowdhury and Mustafa Kamal and Najia Hasan and Nabeel Mohammed},
  journal= {arXiv preprint arXiv:2108.10714},
  year   = {2023}
}

备注

Accepted at 20th International Conference of the Biometrics Special Interest Group (BIOSIG 2021)