中文

利用文本到语音合成改善非典型语音口语理解中的公平性

音频与语音处理 2023-11-20 v1

摘要

口语理解 (SLU) 系统在处理非典型语音(通常由神经系统疾病和运动障碍引起)时往往表现欠佳。近期基于文本到语音 (TTS) 合成的数据增强以实现更公平 SLU 的进展,由于数据不足,难以准确捕捉非典型说话人的独特声学特征。为解决此问题,我们提出一种针对非典型说话人的新型数据增强方法,通过微调名为 Aty-TTS 的 TTS 模型实现。Aty-TTS 借助从语音转换模型的知识迁移来建模说话人及非典型特征。随后,我们使用增强数据训练适配于非典型语音的 SLU 模型。为训练这些数据增强模型并评估所得 SLU 系统,我们收集了一个包含意图标注的新非典型语音数据集。客观与主观评估均证实 Aty-TTS 能够生成高质量的非典型语音。此外,它作为一种有效的数据增强策略,有助于构建更公平的 SLU 系统,更好地服务于具有非典型语音模式的个体。

关键词

引用

@article{arxiv.2311.10149,
  title  = {Improving fairness for spoken language understanding in atypical speech with Text-to-Speech},
  author = {Helin Wang and Venkatesh Ravichandran and Milind Rao and Becky Lammers and Myra Sydnor and Nicholas Maragakis and Ankur A. Butala and Jayne Zhang and Lora Clawson and Victoria Chovaz and Laureano Moro-Velazquez},
  journal= {arXiv preprint arXiv:2311.10149},
  year   = {2023}
}

备注

Accepted at SyntheticData4ML 2023 Oral