使用带通道注意力的深度可分离卷积网络进行少样本说话人识别
音频与语音处理
2022-04-26 v1 声音
摘要
尽管少样本学习已引起图像与音频分类领域的广泛关注,但在少样本说话人识别上的努力甚少。在少样本学习任务中,过拟合是一个棘手问题,主要源于训练与测试条件之间的不匹配。本文提出一种可缓解过拟合问题的少样本说话人识别方法。在该方法中,带通道注意力的深度可分离卷积网络模型以原型损失函数进行训练。实验数据集提取自三个公开语音语料库:Aishell-2、VoxCeleb1与TORGO。实验结果表明,所提方法在准确率与F值方面超越了少样本说话人识别的当前最优方法。
引用
@article{arxiv.2204.11180,
title = {Few-Shot Speaker Identification Using Depthwise Separable Convolutional Network with Channel Attention},
author = {Yanxiong Li and Wucheng Wang and Hao Chen and Wenchang Cao and Wei Li and Qianhua He},
journal= {arXiv preprint arXiv:2204.11180},
year = {2022}
}
备注
Accepted by Odyssey 2022 (The Speaker and Language Recognition Workshop 2022, Beijing, China)