中文

Sylber:基于音节的语音嵌入表示

计算与语言 2025-03-04 v2 声音 音频与语音处理

摘要

音节是语音的组成单位,能高效地组织人类语音的感知和产生。然而,当前的神经语音表示缺乏这种结构,导致生成的令牌序列密集且处理成本高。为弥补这一差距,我们提出了一种新模型Sylber,它能产生具有清晰音节结构的语音表示。具体来说,我们提出了一种自监督学习(SSL)框架,通过从其自身的初始无监督音节分割中蒸馏来引导音节嵌入。这产生了高度结构化的语音特征表示,具有三个关键优势:1)快速、线性时间的音节分割算法;2)高效的音节令牌化,每秒平均产生4.27个令牌;3)新颖的音韵单元,适用于高效的口语语言建模。我们的分割方法高度鲁棒,能泛化到域外数据和未见语言,无需任何调整。通过训练令牌到语音的生成模型,可以从Sylber令牌以显著低于基线SSL令牌的比特率重建完全可理解的语音。这表明我们的模型能将语音高效压缩为紧凑的令牌序列,且信息损失极小。最后,我们展示了范畴感知(一种语音感知中的现象)在Sylber中自然涌现,使得嵌入空间比传统语音特征更具范畴性和稀疏性,从而支持了我们令牌化的高效率。总之,我们提出了一种新颖的SSL方法,将语音表示为音节,为高效语音令牌化和口语建模铺平了道路。

关键词

引用

@article{arxiv.2410.07168,
  title  = {Sylber: Syllabic Embedding Representation of Speech from Raw Audio},
  author = {Cheol Jun Cho and Nicholas Lee and Akshat Gupta and Dhruv Agarwal and Ethan Chen and Alan W Black and Gopala K. Anumanchipalli},
  journal= {arXiv preprint arXiv:2410.07168},
  year   = {2025}
}

备注

Accepted at ICLR 2025