Keyword Transformer:一种用于关键词 spotting 的自注意力模型
音频与语音处理
2022-04-11 v3 计算与语言
机器学习
声音
摘要
Transformer 架构已在自然语言处理、计算机视觉与语音识别等诸多领域取得成功。在关键词 spotting 中,自注意力主要被用于卷积或循环编码器之上。我们探究了一系列使 Transformer 架构适配关键词 spotting 的方法,并提出了 Keyword Transformer (KWT)——一种完全自注意力的架构,无需任何预训练或额外数据即在多项任务上超越 SOTA 性能。令人惊讶的是,这一简单架构优于混合卷积、循环与注意力层的更复杂模型。KWT 可作为这些模型的即插即用替代方案,在 Google Speech Commands 数据集上以 12 命令与 35 命令任务分别 98.6% 和 97.7% 的准确率创下两项新基准纪录。
引用
@article{arxiv.2104.00769,
title = {Keyword Transformer: A Self-Attention Model for Keyword Spotting},
author = {Axel Berg and Mark O'Connor and Miguel Tairum Cruz},
journal= {arXiv preprint arXiv:2104.00769},
year = {2022}
}
备注
Proceedings of INTERSPEECH