中文

通过平滑最大池化学习检测关键词部件与整体

计算与语言 2020-01-29 v1 声音 音频与语音处理

摘要

我们提出了平滑最大池化损失及其在关键词 spotting 系统中的应用。所提方法以半监督方式联合训练编码器(检测关键词部件)与解码器(检测关键词整体)。所提新损失函数允许训练模型检测关键词的部件与整体,而无需严格依赖来自LVCSR(大词汇量连续语音识别)的帧级标注,使进一步优化成为可能。由于可优化性的提升,所提系统优于[1]中的基线关键词 spotting 模型。此外,由于降低了对LVCSR的依赖,它可更易于适配设备端学习应用。

关键词

引用

@article{arxiv.2001.09246,
  title  = {Learning To Detect Keyword Parts And Whole By Smoothed Max Pooling},
  author = {Hyun-Jin Park and Patrick Violette and Niranjan Subrahmanya},
  journal= {arXiv preprint arXiv:2001.09246},
  year   = {2020}
}

备注

Accepted in International Conference on Acoustics, Speech, and Signal Processing 2020