中文

基于特征分组与交互的轻量原型网络少样本说话人识别

音频与语音处理 2023-06-01 v1

摘要

现有少样本说话人识别(FSSI)方法取得了较高准确率,但其计算复杂度和模型大小需降低以满足轻量应用。本文提出一种使用轻量原型网络的 FSSI 方法,最终目标是在资源受限的智能终端(如智能手表和智能音箱)上实现 FSSI。在所提原型网络中,设计了一个嵌入模块来执行特征分组以降低内存需求和计算复杂度,并进行特征交互以增强所学说话人嵌入的表征能力。在该嵌入模块中,每个语音样本的音频特征被拆分为若干低维特征子集,由循环卷积块并行变换。然后依次执行平均、相加、拼接、逐元素求和与统计池化操作,为每个语音样本学习说话人嵌入。循环卷积块由双向长短期记忆块和去冗余卷积块组成,后者也进行特征分组与交互。我们的方法在选自三个公开语音语料库(VoxCeleb1、VoxCeleb2 和 LibriSpeech)的三个数据集上与基线方法比较。结果表明,我们的方法在多种条件下取得更高准确率,并在计算复杂度和模型大小上优于所有基线方法。

关键词

引用

@article{arxiv.2305.19541,
  title  = {Few-Shot Speaker Identification Using Lightweight Prototypical Network with Feature Grouping and Interaction},
  author = {Yanxiong Li and Hao Chen and Wenchang Cao and Qisheng Huang and Qianhua He},
  journal= {arXiv preprint arXiv:2305.19541},
  year   = {2023}
}

备注

12 pages, 4 figures, 12 tables. Accepted for publication in IEEE TMM