中文

TACos:面向动态时间规整少样本关键词 spotting 的时序结构化嵌入学习

音频与语音处理 2023-12-15 v3 声音

摘要

为将信号分割为待分析块,少样本关键词 spotting(KWS)系统常采用固定大小的滑动窗口。由于不同关键词或其语音实例的长度各异,选择合适的窗口大小成为难题:窗口应足够长以包含识别关键词所需的全部必要信息,但更长的窗口可能包含无关信息(如多个词或噪声),从而难以可靠地检测关键词的起止点。我们提出 TACos,一种新颖的角度间隔损失,用于推导保留底层语音信号时序特性的二维嵌入。在本文提出的少样本 KWS 数据集 KWS-DailyTalk 上进行的实验表明,将这些嵌入作为动态时间规整的模板优于使用其他表示或滑动窗口,且训练期间使用关键词的时间反转片段可提升性能。

关键词

引用

@article{arxiv.2305.10816,
  title  = {TACos: Learning Temporally Structured Embeddings for Few-Shot Keyword Spotting with Dynamic Time Warping},
  author = {Kevin Wilkinghoff and Alessia Cornaggia-Urrigshardt},
  journal= {arXiv preprint arXiv:2305.10816},
  year   = {2023}
}

备注

Accepted for presentation at IEEE ICASSP 2024