中文

DARS:基于失语症意识的节奏-风格合成用于语音识别增强

声音 2026-03-03 v1 计算与语言

摘要

失语症患者的语音呈现异常的韵律和显著的说话者可变性,这给自动语音识别(ASR)带来了持续的挑战。虽然基于文本语音合成(TTS)的数据增强方法显示出潜力,但现有方法往往无法准确地建模失语症语音的病理节奏和声学风格。为此,我们提出了 DARS(Dysarthria-Aware Rhythm-Style Synthesis),一个基于 Matcha-TTS 架构的失语症意识节奏-风格合成框架。DARS 包含一个由正常语音与失语症语音之间的对比偏好优化的多阶段节奏预测器,以及失语症风格条件流匹配机制,联合增强时序节奏重建和病理声学风格模拟。在 TORGO 数据集上的实验表明,DARS 实现的平均声谱失真(MCD)为 4.29,接近真实失语症语音。使用来自 DARS 的合成失语症语音适配基于 Whisper 的 ASR 系统,可实现约 54.22% 的词错误率(WER)相对降低,证明了该框架在提升识别性能方面的有效性。

关键词

引用

@article{arxiv.2603.01369,
  title  = {DARS: Dysarthria-Aware Rhythm-Style Synthesis for ASR Enhancement},
  author = {Minghui Wu and Xueling Liu and Jiahuan Fan and Haitao Tang and Yanyong Zhang and Yue Zhang},
  journal= {arXiv preprint arXiv:2603.01369},
  year   = {2026}
}

备注

Submitted to 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)