中文

针对鲁棒性的小体积关键词检测中的解缠训练——基于对抗样本

声音 2024-08-27 v1 人工智能 音频与语音处理

摘要

在设备上持续运行的关键词检测(KWS)引擎会暴露于各种此前未遇到的语音信号。构建具备不同声学环境下鲁棒性的小体积高性能KWS模型是一个具有挑战性的问题。本文探索了如何有效地将对抗样本应用于提高KWS鲁棒性。我们提出了一种基于数据源感知的解缠学习策略,以减少原始数据与对抗数据之间的差异以及不同原始训练数据源之间的差异。KWS模型架构基于深度可分离卷积和一个简单的注意力模块。实验结果表明,所提出的学习策略在内部数据集上,将在1%误接收率下的误接收率降低了40.31%。我们的最佳性能系统在Google Speech Commands V1 数据集上实现了98.06%的准确率。

关键词

引用

@article{arxiv.2408.13355,
  title  = {Disentangled Training with Adversarial Examples For Robust Small-footprint Keyword Spotting},
  author = {Zhenyu Wang and Li Wan and Biqiao Zhang and Yiteng Huang and Shang-Wen Li and Ming Sun and Xin Lei and Zhaojun Yang},
  journal= {arXiv preprint arXiv:2408.13355},
  year   = {2024}
}