中文

ConvMixer:面向小 footprint 与噪声远场关键词 spotting 的特征交互卷积与课程学习

声音 2023-05-09 v1 音频与语音处理

摘要

在神经语音处理中构建高效架构对于关键词 spotting 的部署至关重要。然而,轻量级模型以简洁的神经操作实现噪声鲁棒性极具挑战。在真实应用中,用户环境通常含有噪声并可能包含混响。我们提出了一种仅含 100K 参数的新颖特征交互卷积模型,以在噪声远场条件下解决此问题。该交互单元替代注意力模块,以更高效的计算促进信息流动。此外,采用基于课程的多条件训练以获得更好的噪声鲁棒性。我们的模型在 Google Speech Command V2-12 上达到 98.2% 的 top-1 准确率,并在所设计的噪声条件下与大型 transformer 模型具有竞争力。

关键词

引用

@article{arxiv.2201.05863,
  title  = {ConvMixer: Feature Interactive Convolution with Curriculum Learning for Small Footprint and Noisy Far-field Keyword Spotting},
  author = {Dianwen Ng and Yunqi Chen and Biao Tian and Qiang Fu and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2201.05863},
  year   = {2023}
}

备注

submitted to ICASSP 2022