中文

使用带通道注意力的深度可分离卷积网络进行少样本说话人识别

音频与语音处理 2022-04-26 v1 声音

摘要

尽管少样本学习已引起图像与音频分类领域的广泛关注,但在少样本说话人识别上的努力甚少。在少样本学习任务中,过拟合是一个棘手问题,主要源于训练与测试条件之间的不匹配。本文提出一种可缓解过拟合问题的少样本说话人识别方法。在该方法中,带通道注意力的深度可分离卷积网络模型以原型损失函数进行训练。实验数据集提取自三个公开语音语料库:Aishell-2、VoxCeleb1与TORGO。实验结果表明,所提方法在准确率与F值方面超越了少样本说话人识别的当前最优方法。

关键词

引用

@article{arxiv.2204.11180,
  title  = {Few-Shot Speaker Identification Using Depthwise Separable Convolutional Network with Channel Attention},
  author = {Yanxiong Li and Wucheng Wang and Hao Chen and Wenchang Cao and Wei Li and Qianhua He},
  journal= {arXiv preprint arXiv:2204.11180},
  year   = {2022}
}

备注

Accepted by Odyssey 2022 (The Speaker and Language Recognition Workshop 2022, Beijing, China)