基于特征分组与交互的轻量原型网络少样本说话人识别
音频与语音处理
2023-06-01 v1
摘要
现有少样本说话人识别(FSSI)方法取得了较高准确率,但其计算复杂度和模型大小需降低以满足轻量应用。本文提出一种使用轻量原型网络的 FSSI 方法,最终目标是在资源受限的智能终端(如智能手表和智能音箱)上实现 FSSI。在所提原型网络中,设计了一个嵌入模块来执行特征分组以降低内存需求和计算复杂度,并进行特征交互以增强所学说话人嵌入的表征能力。在该嵌入模块中,每个语音样本的音频特征被拆分为若干低维特征子集,由循环卷积块并行变换。然后依次执行平均、相加、拼接、逐元素求和与统计池化操作,为每个语音样本学习说话人嵌入。循环卷积块由双向长短期记忆块和去冗余卷积块组成,后者也进行特征分组与交互。我们的方法在选自三个公开语音语料库(VoxCeleb1、VoxCeleb2 和 LibriSpeech)的三个数据集上与基线方法比较。结果表明,我们的方法在多种条件下取得更高准确率,并在计算复杂度和模型大小上优于所有基线方法。
引用
@article{arxiv.2305.19541,
title = {Few-Shot Speaker Identification Using Lightweight Prototypical Network with Feature Grouping and Interaction},
author = {Yanxiong Li and Hao Chen and Wenchang Cao and Qisheng Huang and Qianhua He},
journal= {arXiv preprint arXiv:2305.19541},
year = {2023}
}
备注
12 pages, 4 figures, 12 tables. Accepted for publication in IEEE TMM