中文

MT-HuBERT:基于混合训练的自监督少样本关键词定位

声音 2025-11-11 v1

摘要

少样本关键词定位旨在检测极少标记样本的未知关键词。通常采用预训练和适应范式。虽然在干净条件下有效,但大多数现有方法在混合关键词定位——检测单个语音中多个重叠关键词——方面难以应对,这是实际应用中必不可少的能力。我们之前提出了基于混合训练(MT)的预训练方法,旨在解决混合关键词检测问题,已证明其有效性。然而,该方法是完全监督的,无法利用大量无标签数据。为此,我们提出混合训练HuBERT(MT-HuBERT),一种在预训练期间实现MT准则的自监督学习(SSL)框架。MT-HuBERT以自监督方式预测来自上下文线索的每个组成信号的干净声学单元,与预测混合语音的组成模式不同。在Google Speech Commands(GSC v2)语料库上进行的实验表明,在混合和干净条件下的少样本关键词定位任务中,所提出的MT-HuBERT consistently优于多个最先进的基线方法。

关键词

引用

@article{arxiv.2511.06296,
  title  = {MT-HuBERT: Self-Supervised Mix-Training for Few-Shot Keyword Spotting in Mixed Speech},
  author = {Junming Yuan and Ying Shi and Dong Wang and Lantian Li and Askar Hamdulla},
  journal= {arXiv preprint arXiv:2511.06296},
  year   = {2025}
}