中文

ZeroSyl:面向口语语言建模的简单零资源音节分词方法

计算与语言 2026-02-18 v1 音频与语音处理

摘要

纯语音语言模型旨在直接从原始音频中学习语言,无需文本资源。一个关键挑战是,来自自监督语音编码器的离散标记会导致序列过长,这促使了近期关于音节级单元的研究。然而,像Sylber和SyllableLM这样的方法依赖于复杂的多阶段训练流程。我们提出了ZeroSyl,一种简单的免训练方法,可直接从冻结的WavLM模型中提取音节边界和嵌入。利用WavLM中间层特征的L2范数,ZeroSyl实现了具有竞争力的音节分割性能。得到的片段经过均值池化、使用K-means离散化,并用于训练语言模型。在词汇、句法和叙事基准测试中,ZeroSyl优于先前的音节分词器。缩放实验表明,虽然更细粒度的单元有利于词汇任务,但我们发现的音节单元在句法建模方面表现出更好的缩放行为。

关键词

引用

@article{arxiv.2602.15537,
  title  = {ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling},
  author = {Nicol Visser and Simon Malan and Danel Slabbert and Herman Kamper},
  journal= {arXiv preprint arXiv:2602.15537},
  year   = {2026}
}

备注

3 figures, 2 tables