中文

语音自监督模型推断通用的发音运动学

音频与语音处理 2024-01-17 v2 计算与语言

摘要

基于自监督学习(Self-Supervised Learning, SSL)的语音模型在一系列下游任务上展现出卓越性能。这些最先进的模型一直是黑箱,但许多近期研究已开始对 HuBERT 等模型进行“探测”,以将其内部表示与语音的不同方面相关联。在本文中,我们表明“发音运动学的推断”是 SSL 模型的基本属性,即这些模型将声学转换为语音信号背后的因果发音动态的能力。我们还表明,这种抽象在用于训练模型的数据语言之间很大程度上是重叠的,且偏向于具有相似音系系统的语言。此外,我们表明通过简单的仿射变换,声学到发音反演(Acoustic-to-Articulatory inversion, AAI)可跨说话人迁移,甚至跨性别、语言和方言,显示了该属性的泛化能力。总之,这些结果揭示了 SSL 模型内部对其优越性能至关重要的机制,并为语音工程中可解释且基于语音科学的语言无关通用模型开辟了新途径。

关键词

引用

@article{arxiv.2310.10788,
  title  = {Self-Supervised Models of Speech Infer Universal Articulatory Kinematics},
  author = {Cheol Jun Cho and Abdelrahman Mohamed and Alan W Black and Gopala K. Anumanchipalli},
  journal= {arXiv preprint arXiv:2310.10788},
  year   = {2024}
}