中文

使用对抗数据增强优化预训练ASR系统在构音障碍语音识别中的微调

声音 2024-01-02 v1 音频与语音处理

摘要

迄今为止,构音障碍语音的自动识别仍是一项极具挑战性的任务。神经运动障碍及伴发的身体残疾导致难以大规模收集数据以开发ASR系统。通过数据密集型参数微调将SSL预训练ASR模型适应于有限的构音障碍语音,会导致泛化能力差。为此,本文对各种数据增强方法进行了广泛的比较研究,以提高预训练ASR模型在微调面对构音障碍语音时的鲁棒性。这些方法包括:a) 针对受损语音的传统说话人无关扰动;b) 基于与平行构音障碍语音的时间对齐,对正常对照语音进行的说话人相关速度扰动,或基于GAN的对抗扰动;c) 在非平行数据上操作的基于谱基GAN的新型对抗数据增强。在UASpeech语料库上进行的实验表明,基于GAN的数据增强在UASpeech的16名构音障碍说话人测试集上,在不同数据扩展操作点上始终优于无数据增强和速度扰动的微调Wav2vec2.0和HuBERT模型,词错误率(WER)绝对降低最高达2.01%和0.96%(相对降低9.03%和4.63%),具有统计显著性。经过跨系统输出重打分,最佳系统在UASpeech上取得了已发表的最低WER 16.53%(在极低可懂度上为46.47%)。

关键词

引用

@article{arxiv.2401.00662,
  title  = {Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation},
  author = {Huimeng Wang and Zengrui Jin and Mengzhe Geng and Shujie Hu and Guinan Li and Tianzi Wang and Haoning Xu and Xunying Liu},
  journal= {arXiv preprint arXiv:2401.00662},
  year   = {2024}
}

备注

To appear at IEEE ICASSP 2024