中文

面向嵌入式系统的小 footprint 文本无关说话人验证

声音 2021-04-22 v2 计算与语言 机器学习 音频与语音处理

摘要

深度神经网络说话人验证方法已被证明是成功的,但最先进(SOTA)系统的典型计算需求使其不适合嵌入式应用。本工作中,我们提出一种两阶段模型架构,其规模比常见方案小几个数量级(237.5K 学习参数,11.5MFLOPS),在公认的 VoxCeleb1 验证测试集上达到了 3.31% 等错误率(EER)的竞争性结果。我们展示了在物联网系统典型的小型设备(如 Raspberry Pi 3B)上运行本方案的可能性,对 5 秒长语音的延迟小于 200ms。此外,我们在声学上具有挑战性的 VOiCES 语料库上评估了我们的模型。相对于 2019 年 VOiCES from a Distance 挑战赛得分最高的模型,我们的 EER 仅增加 2.6 个百分点,而学习参数数量减少了 25.6 倍。

关键词

引用

@article{arxiv.2011.01709,
  title  = {Small footprint Text-Independent Speaker Verification for Embedded Systems},
  author = {Julien Balian and Raffaele Tavarone and Mathieu Poumeyrol and Alice Coucke},
  journal= {arXiv preprint arXiv:2011.01709},
  year   = {2021}
}