中文

Keyword Transformer:一种用于关键词 spotting 的自注意力模型

音频与语音处理 2022-04-11 v3 计算与语言 机器学习 声音

摘要

Transformer 架构已在自然语言处理、计算机视觉与语音识别等诸多领域取得成功。在关键词 spotting 中,自注意力主要被用于卷积或循环编码器之上。我们探究了一系列使 Transformer 架构适配关键词 spotting 的方法,并提出了 Keyword Transformer (KWT)——一种完全自注意力的架构,无需任何预训练或额外数据即在多项任务上超越 SOTA 性能。令人惊讶的是,这一简单架构优于混合卷积、循环与注意力层的更复杂模型。KWT 可作为这些模型的即插即用替代方案,在 Google Speech Commands 数据集上以 12 命令与 35 命令任务分别 98.6% 和 97.7% 的准确率创下两项新基准纪录。

关键词

引用

@article{arxiv.2104.00769,
  title  = {Keyword Transformer: A Self-Attention Model for Keyword Spotting},
  author = {Axel Berg and Mark O'Connor and Miguel Tairum Cruz},
  journal= {arXiv preprint arXiv:2104.00769},
  year   = {2022}
}

备注

Proceedings of INTERSPEECH