中文

SpidR:无监督学习快速稳定语言单元用于 spoken language models

计算与语言 2025-12-29 v2 声音 音频与语音处理

摘要

语言建模与语音表示学习的并行进展为从无文本中间体直接从语音中学习语言的前景。这需要从语音中直接提取语义表示。我们的贡献有三点。首先,我们引入 SpidR,一个自监督语音表示模型,高效学习具有高度可访问语音信息的表示,特别适合用于 textless spoken language modeling。它使用掩码预测目标结合自蒸馏和在线聚类进行训练。学生模型的中间层学习预测来自教师模型中间层派生的分配。这一学习目标相较于先前方法稳定了在线聚类程序,导致更高质量的 codebook。SpidR 在下游语言建模基准(sWUGGY、sBLIMP、tSC)上超越 wav2vec 2.0、HuBERT、WavLM 和 DinoSR。其次,我们系统评估了不同模型和层之间语音单元质量(ABX、PNMI)与语言建模性能之间的相关性,验证了这些指标作为可靠代理指标。最后,SpidR 显著减少了预训练时间,仅需16个 GPU 的一天预训练即可,取代原本一周的训练。这一加速由预训练方法和高效代码库所致,后者允许更快的迭代和更轻松的实验。我们开源了训练代码和模型检查点,地址为 https://github.com/facebookresearch/spidr。

关键词

引用

@article{arxiv.2512.20308,
  title  = {SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision},
  author = {Maxime Poli and Mahi Luthra and Youssef Benchekroun and Yosuke Higuchi and Martin Gleize and Jiayi Shen and Robin Algayres and Yu-An Chung and Mido Assran and Juan Pino and Emmanuel Dupoux},
  journal= {arXiv preprint arXiv:2512.20308},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research. 30 pages, 16 figures