中文

用于构音障碍与老年人语音识别的个性化对抗数据增强

音频与语音处理 2025-11-05 v3 人工智能

摘要

尽管面向正常语音的自动语音识别(ASR)技术进展迅速,构音障碍与老年人语音的准确识别至今仍是极具挑战的任务。由于此类用户常存在行动障碍,难以收集大量此类数据用于 ASR 系统开发。为此,数据增强技术起着至关重要的作用。与现有仅修改语速或谱轮廓整体形状的数据增强技术不同,本文使用一组新颖的基于说话人相关(SD)生成对抗网络(GAN)的数据增强方法,对构音障碍、老年与正常语音间的细粒度谱-时差进行建模。这些方法灵活支持:a) 当存在并行语音数据时,将时序或速度扰动的正常语音谱修改为更接近受损说话人;以及 b) 对于非并行数据,将 SVD 分解的正常语音谱基特征转换为目标老年说话人的特征,再与时基重组以生成用于最先进 TDNN 与 Conformer ASR 系统训练的增强数据。实验在四项任务上进行:英语 UASpeech 与 TORGO 构音障碍语音语料库;英语 DementiaBank Pitt 与粤语 JCCOCC MoCA 老年人语音数据集。所提基于 GAN 的数据增强方法在 TORGO 与 DementiaBank 数据上分别始终以最高 0.91% 与 3.0% 绝对(9.61% 与 6.4% 相对)词错率(WER)下降优于基线速度扰动方法。在应用基于 LHUC 的说话人自适应后,一致的性能提升得以保持。

关键词

引用

@article{arxiv.2205.06445,
  title  = {Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition},
  author = {Zengrui Jin and Mengzhe Geng and Jiajun Deng and Tianzi Wang and Shujie Hu and Guinan Li and Xunying Liu},
  journal= {arXiv preprint arXiv:2205.06445},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2202.10290