中文

优化构音障碍唤醒词检测:面向 SLT 2024 LRDWWS 挑战的端到端方法

声音 2024-09-17 v1 人机交互 音频与语音处理

摘要

语音已成为各种应用中广泛采用的用户界面。然而,对于患有构音障碍的个体而言,其语音固有的变异性带来了巨大挑战。本文提出了一种端到端的基于预训练的双滤波器构音障碍唤醒词检测系统,用于 SLT 2024 低资源构音障碍唤醒词检测挑战赛。具体而言,我们的系统从两个关键视角提升了性能:音频建模和双滤波器策略。在音频建模方面,我们提出了一种基于预训练 data2vec2 (d2v2) 的创新性 2branch-d2v2 模型,该模型能够通过统一的多任务微调范式,同时建模自动语音识别(ASR)和唤醒词检测任务。此外,引入了双滤波器策略,以在保持相同错误拒绝率的前提下降低错误接受率。实验结果表明,我们的 PD-DWS 系统在 test-B 评估集上实现了 0.00321 的 FAR 和 0.005 的 FRR,总分为 0.00821,在挑战赛中荣获第一名。

关键词

引用

@article{arxiv.2409.10076,
  title  = {Optimizing Dysarthria Wake-Up Word Spotting: An End-to-End Approach for SLT 2024 LRDWWS Challenge},
  author = {Shuiyun Liu and Yuxiang Kong and Pengcheng Guo and Weiji Zhuang and Peng Gao and Yujun Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2409.10076},
  year   = {2024}
}

备注

8 pages, Accepted to SLT 2024