中文

SD-HuBERT:句子级自蒸馏在 HuBERT 中诱导音节结构组织

计算与语言 2025-04-11 v3 音频与语音处理

摘要

语音自监督学习(SSL)中的数据驱动单元发现已开启了口语处理的新时代。然而,所发现的单元往往停留在音素空间,而超越音素的单元在很大程度上未被充分探索。在此,我们展示了在学习语音的句子级表示时会出现音节结构组织。具体而言,我们采用“自蒸馏”目标,使用汇总整个句子的聚合器 token 对预训练的 HuBERT 进行微调。在没有任何监督的情况下,所得模型在语音中画出明确边界,且跨帧的表示呈现出显著的音节结构。我们证明这种涌现结构在很大程度上对应于真实音节。此外,我们提出了一项新的基准任务 Spoken Speech ABX,用于评估语音的句子级表示。与先前模型相比,我们的模型在无监督音节发现和句子级表示学习上都表现更优。总之,我们证明了 HuBERT 的自蒸馏无需依赖外部标签或模态即可产生音节结构组织,并可能为口语语言建模提供新颖的数据驱动单元。

关键词

引用

@article{arxiv.2310.10803,
  title  = {SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT},
  author = {Cheol Jun Cho and Abdelrahman Mohamed and Shang-Wen Li and Alan W Black and Gopala K. Anumanchipalli},
  journal= {arXiv preprint arXiv:2310.10803},
  year   = {2025}
}