基于 SSL 模型分层特征的儿童语音零样本关键词检测
音频与语音处理
2025-09-01 v1 人工智能
人机交互
声音
信号处理
摘要
已提出诸多方法来增强成人语音的关键词检测(Keyword Spotting, KWS),但由于其独特的声学和语言特征,儿童语音为 KWS 系统带来了独特挑战。本文引入一种零样本 KWS 方法,利用最先进的自监督学习(self-supervised learning, SSL)模型,包括 Wav2Vec2、HuBERT 和 Data2Vec。从这些 SSL 模型中提取分层特征,用于训练基于 Kaldi 的 DNN KWS 系统。使用 WSJCAM0 成人语音数据集进行训练,使用 PFSTAR 儿童语音数据集进行测试,展示了该方法的零样本能力。我们的做法在所有关键词集合上均取得了最新的结果。特别地,Wav2Vec2 模型,特别是第22层,表现最佳,给出 ATWV 为 0.691、MTWV 为 0.7003,以及误报概率为 0.0164、漏报概率为 0.0547,针对 30 个关键词。此外,年龄特定的性能评估确认了该系统在不同年龄段儿童中的有效性。为评估系统对噪声的鲁棒性,还对最佳 Wav2Vec2 模型的最佳层进行了额外实验。结果显示,其对传统 MFCC 基线方法具有显著的改进,凸显了即使在噪声条件下 SSL 嵌入也具有潜力。为进一步泛化 KWS 框架,还对另一个 CMU 数据集重复了实验。总体而言,结果突显了 SSL 特征在增强儿童语音零样本 KWS 性能方面的重要贡献,有效解决了儿童说话者独特特征所带来的挑战。
引用
@article{arxiv.2508.21248,
title = {Zero-Shot KWS for Children's Speech using Layer-Wise Features from SSL Models},
author = {Subham Kutum and Abhijit Sinha and Hemant Kumar Kathania and Sudarsana Reddy Kadiri and Mahesh Chandra Govil},
journal= {arXiv preprint arXiv:2508.21248},
year = {2025}
}
备注
Accepted