基于帧级适配器和多等待-k知识蒸馏的端到端同声功能重建
声音
2026-03-03 v1 计算与语言
摘要
功能性语音重建(DSR)通常采用级联系统,将自动语音识别(ASR)和句子级文本到语音(TTS)组合,以将功能性语音转换为正常韵律的语音。然而,功能性语音者常言语较慢,导致此类系统响应时间过长,在长语音场景中难以实用。基于流式ASR和增量TTS的级联DSR系统可帮助降低延迟。然而,不同程度的功能性语音患者对相同文本表现出显著的发音差异,导致ASR鲁棒性差,限制了重建语音的可理解性。此外,增量TTS因感受野有限,难以准确预测韵律特征。本研究提出一种端到端同声DSR系统,包含两个关键创新:1)引入帧级适配器模块连接ASR与TTS。通过显式-隐式语义信息融合和联合模块训练,增强TTS对ASR输出的容错能力。2)设计多等待-k自回归TTS模块,通过多视角知识蒸馏缓解韵律退化。该系统在Tesla A100上平均响应时间为1.03秒,平均实时因子(RTF)为0.71。在UASpeech数据集上实现平均意见分数(MOS)为4.67,相较于当前最先进技术相减半(54.25%)的词错误率(WER)。我们的演示可在 https://wflrz123.github.io/ 查看。
引用
@article{arxiv.2603.01382,
title = {End-to-End Simultaneous Dysarthric Speech Reconstruction with Frame-Level Adaptor and Multiple Wait-k Knowledge Distillation},
author = {Minghui Wu and Haitao Tang and Jiahuan Fan and Ruizhi Liao and Yanyong Zhang},
journal= {arXiv preprint arXiv:2603.01382},
year = {2026}
}
备注
Submitted to 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)