基于软聚类锚点的自监督语音表征学习中的联合嵌入预测架构
音频与语音处理
2026-02-11 v1 人工智能
机器学习
声音
摘要
联合嵌入预测架构(JEPA)提供了一种自监督语音表征学习的有前景的方案,但由于缺乏显式 grounding 而 suffer from 表示坍缩。我们提出了基于 GMM 锚点的 JEPA 方法,通过在 log-mel 频谱图上拟合一次高斯混合模型(GMM),并使用其冻结的软后验作为训练期间的辅助目标。通过一个递减的监督计划,允许 GMM 正则化在早期训练中占主导地位,然后逐渐让位于 JEPA 目标。与 HuBERT 和 WavLM 不同,后者需要迭代重新聚类,我们的方法使用软而非硬的赋值对输入特征进行聚类。实验表明,在约 50k 小时的语音数据上,GMM 锚定的方法在语音识别(WER 28.68% vs. 33.22%)、情感识别(67.76% vs. 65.46%)和槽位填充(64.7% vs. 59.1% F1)方面均优于计算量相同的 WavLM 风格基线。聚类分析显示,GMM 锚定的表征在聚类熵上可达 98%,而 WavLM 风格的方法仅为 31%,表明其聚类利用率显著更均匀。代码已在 https://github.com/gioannides/clustering-anchored-jepa 上公开。
引用
@article{arxiv.2602.09040,
title = {Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures},
author = {Georgios Ioannides and Adrian Kieback and Judah Goldfeder and Linsey Pang and Aman Chadha and Aaron Elkins and Yann LeCun and Ravid Shwartz-Ziv},
journal= {arXiv preprint arXiv:2602.09040},
year = {2026}
}
备注
15 pages, 5 figures. Code: github.com/gioannides/clustering-anchored-jepa