JEPA作为神经分词器:通过密度自适应注意力学习鲁棒的语音表征
声音
2025-12-09 v1 人工智能
机器学习
音频与语音处理
摘要
我们提出了一种两阶段自监督框架,将联合嵌入预测架构(JEPA)与密度自适应注意力机制(DAAM)相结合,用于学习鲁棒的语音表征。第一阶段使用带有DAAM的JEPA通过潜在空间中的掩码预测学习语义音频特征,完全独立于波形重建。第二阶段利用这些表征通过有限标量量化(FSQ)和混合进制打包方案进行高效分词,随后通过HiFi-GAN解码器进行高保真波形重建。通过在JEPA编码器中集成基于高斯混合的密度自适应门控,该模型执行自适应时间特征选择,并在2.5 Hz的低帧率下发现层次化语音结构。生成的标记(每秒47.5个标记)提供了一种可逆、高度压缩且对语言模型友好的表征,在与现有神经音频编解码器相比时具有竞争力,且通常更加高效。
引用
@article{arxiv.2512.07168,
title = {JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention},
author = {Georgios Ioannides and Christos Constantinou and Aman Chadha and Aaron Elkins and Linsey Pang and Ravid Shwartz-Ziv and Yann LeCun},
journal= {arXiv preprint arXiv:2512.07168},
year = {2025}
}
备注
UniReps: Unifying Representations in Neural Models (NeurIPS 2025 Workshop)