中文

受限场景下句子级语颤 speech 识别的零射与一射数据增强

声音 2025-10-21 v1

摘要

受语颤 (dysarthria) 者的语音识别 (DSR) 研究近年来取得了显著进展,由最初的单个词理解,发展到对句子级表达的精细理解,这一进展离不开对这类人群沟通需求的迫切关注。然而,数据稀缺性仍是制约构建有效句子级 DSR 系统的主要障碍。在此背景下,受语颤数据增强 (DDA) 应运而生,成为备受期待的解决路径。生成模型常用于为自动语音识别任务生成训练数据,但其效果取决于合成数据能否准确代表目标领域。由于受语颤者发音变异性极大,基于现有说话人数据训练的模型,难以在零射或一射学习场景下生成有效的增强数据。为此,本文提出一种专为文本匹配数据合成设计的新型文本覆盖策略,该策略实现了零射/一射 DDA 的高效运行,显著提升了在面对未知语颤说话人时 DSR 系统的性能。此类改进在实际应用中具有重要意义,包括语颤康复项目和日常常用句子沟通场景。

关键词

引用

@article{arxiv.2510.16700,
  title  = {Zero- and One-Shot Data Augmentation for Sentence-Level Dysarthric Speech Recognition in Constrained Scenarios},
  author = {Shiyao Wang and Shiwan Zhao and Jiaming Zhou and Yong Qin},
  journal= {arXiv preprint arXiv:2510.16700},
  year   = {2025}
}

备注

NCMMSC 2025 oral