面向低资源关键词 spotting 的对比语音混合增强
声音
2023-05-03 v1 音频与语音处理
摘要
现有大多数用于智能设备关键词 spotting (KWS) 的基于神经网络的模型需要数千个训练样本来学习良好的音频表示。然而,随着智能设备日益个性化需求的增长,KWS 模型需要快速适应用户的小样本。为应对这一挑战,我们提出了一种用于低资源 KWS 的对比语音混合增强 (CosMix) 学习算法。CosMix 在现有 mixup 增强技术上引入辅助对比损失,以最大化原始混合前样本与增强样本之间的相对相似性。其目标是注入增强约束,引导模型从两个增强视图(即含噪混合语音与干净混合前语音)中学习更简单但更丰富的基于内容的语音表示。我们在 Google Speech Command 数据集上进行实验,将训练集规模裁剪至每个关键词仅 2.5 分钟以模拟低资源条件。实验结果表明多种模型的性能均有持续提升,证明了我们方法的有效性。
引用
@article{arxiv.2305.01170,
title = {Contrastive Speech Mixup for Low-resource Keyword Spotting},
author = {Dianwen Ng and Ruixi Zhang and Jia Qi Yip and Chong Zhang and Yukun Ma and Trung Hieu Nguyen and Chongjia Ni and Eng Siong Chng and Bin Ma},
journal= {arXiv preprint arXiv:2305.01170},
year = {2023}
}
备注
Accepted by ICASSP 2023