SSDM 2.0:带非流畅性的语音丰富转录
音频与语音处理
2024-12-03 v1
摘要
语音是文本、韵律、情感、非流畅性等层次结构的集合。超越文本(单词)进行语音自动转录仍是一个未被充分探索的问题。我们专注于转录包含非流畅性(语病)的语音。当前的状态生成管道 SSDM 面临复杂的体系结构设计、训练复杂性以及在局部序列对齐器方面的显著不足,还未探索其 in-context 学习能力。在本文中,我们提出了 SSDM 2.0,通过四个主要贡献来解决这些问题:(1) 我们提出了一种新颖的神经官能流,用于高度可扩展的语音表示。(2) 我们开发了一个全栈连接主子序列对齐器,能够捕获所有类型的非流畅性。(3) 我们将一种误音提示管道和一致性学习模块引入 LLM,以利用非流畅性的 in-context pronunciation 学习能力。(4) 我们精选了 Libri-Dys 并开源了当前规模最大的共非流畅语料库 Libri-Co-Dys,用于未来的研究。我们在以 nfvPPA 语料库为主、以 articulatory dysfluencies 为特征的病态语音转录临床实验中测试了 SSDM 2.0。总体而言,SSDM 2.0 在 SSDM 和所有其他非流畅性转录模型方面均表现出显著优势。参见我们的项目演示页面 https://berkeley-speech-group.github.io/SSDM2.0/。
引用
@article{arxiv.2412.00265,
title = {SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies},
author = {Jiachen Lian and Xuanru Zhou and Zoe Ezzes and Jet Vonk and Brittany Morin and David Baquirin and Zachary Mille and Maria Luisa Gorno Tempini and Gopala Krishna Anumanchipalli},
journal= {arXiv preprint arXiv:2412.00265},
year = {2024}
}