混合语音下的少样本关键词检测
声音
2024-07-09 v1
摘要
少样本关键词检测 (KWS) 旨在检测带有限训练样本的未知关键词。常用方法是预训练和微调框架。尽管在干净条件下有效,但该方法在混合关键词检测方面仍面临挑战——即同时检测混合语音中多个关键词,这在实际应用中至关重要。以前的研究提出了 Mix-Training (MT) 方法来解决此问题,但从未在少样本情境下进行测试。本文调查在两种实际挑战同时出现的情形下,使用 MT 及其他相关方法的可能性:少样本和混合语音。在 LibriSpeech 和 Google Speech Command 语料库上进行的实验表明,MT 在本任务上非常有效,可在预训练阶段或微调阶段采用。此外,结合 SSL 基于大规模预训练 (HuBert) 和 MT 微调可在所有测试条件下获得极强的结果。
引用
@article{arxiv.2407.06078,
title = {Few-Shot Keyword Spotting from Mixed Speech},
author = {Junming Yuan and Ying Shi and LanTian Li and Dong Wang and Askar Hamdulla},
journal= {arXiv preprint arXiv:2407.06078},
year = {2024}
}
备注
accepted by INTERSPEECH 2024