中文

SSDM:可扩展语音不完整性建模

音频与语音处理 2024-10-07 v3 人工智能 计算与语言 声音

摘要

语音不完整性建模是 spoken language learning 和语音治疗的核心模块,但面临三个挑战。首先,当前的 SOTA 解决方案[lian2023unconstrained-udm, lian-anumanchipalli-2024-towards-hudm] 受限于可扩展性。其次,缺乏大规模不完整性语料库。最后,缺乏有效的学习框架。本文提出 \textit{SSDM:可扩展语音不完整性建模}, (1) 采用 articulatory gestures 作为可扩展强制对齐;(2) 引入 connectionist subsequence aligner (CSA) 实现不完整性对齐;(3) 引入大规模模拟不完整性语料库称为 Libri-Dys;以及 (4) 通过利用大语言模型 (LLM) 的强大功能开发端到端系统。我们期望 SSDM 成为该领域不完整性建模的标准。演示可在 \url{https://berkeley-speech-group.github.io/SSDM/} 访问。

关键词

引用

@article{arxiv.2408.16221,
  title  = {SSDM: Scalable Speech Dysfluency Modeling},
  author = {Jiachen Lian and Xuanru Zhou and Zoe Ezzes and Jet Vonk and Brittany Morin and David Baquirin and Zachary Mille and Maria Luisa Gorno Tempini and Gopala Krishna Anumanchipalli},
  journal= {arXiv preprint arXiv:2408.16221},
  year   = {2024}
}

备注

2024 NeurIPS