中文

Sylber 2.0:通用元音嵌入

音频与语音处理 2026-02-02 v1 计算与语言

摘要

扩大口语语言建模的规模需要高效且通用的语音 token。近期研究提出将元音作为低时间分辨率下的语音 token,但现有模型仅限于英语且未能捕捉足够的声学细节。为此,我们提出了 Sylber 2.0,一个自监督框架,用于在元音水平对语音进行编码,实现高效的时间压缩和高保真重构。Sylber 2.0 达到约 5 Hz 的极低 token 频率,同时保留多语言和多样化表达风格中的语言和声学细节。实验表明,其在与高频基线模型operating on par。此外,Sylber 2.0 使高效 TTS 建模成为可能,使用仅 72M 参数即可生成具有竞争力的语音可懂性和质量。进一步,Sylber 2.0 的通用性为低资源 ASR 提供了更有效的特征。总之,我们建立了通用口语语言的有效元音级抽象。

关键词

引用

@article{arxiv.2601.22306,
  title  = {Sylber 2.0: A Universal Syllable Embedding},
  author = {Cheol Jun Cho and Nicholas Lee and Alan W Black and Gopala K. Anumanchipalli},
  journal= {arXiv preprint arXiv:2601.22306},
  year   = {2026}
}