中文

Audio-JEPA:面向音频表征学习的联合嵌入预测架构

声音 2025-07-08 v1 人工智能 机器学习 音频与语音处理 信号处理

摘要

基于联合嵌入预测架构(JEPA)范式(一种最近的自监督学习框架,用于预测高层特征空间中掩码区域的潜在表征),我们提出了 Audio-JEPA(音频联合嵌入预测架构),专门针对音频数据定制。Audio-JEPA 使用简单的 Vision Transformer 骨干网络来预测掩码频谱图块的潜在表征,而不是重建原始音频。我们在未标注的 AudioSet 片段(10 秒,32kHz)上进行预训练,对梅尔频谱图进行随机块掩码。我们在涵盖语音、音乐和环境声音任务的 X-ARES 套件上进行评估。尽管我们的实现是将原始模型直接迁移到音频领域,但结果仍显示出与 wav2vec 2.0 和 data2vec 相当的性能,同时使用的训练数据不到它们的五分之一,且无需超参数调优。所有代码和预训练检查点将在 GitHub 上发布。

关键词

引用

@article{arxiv.2507.02915,
  title  = {Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning},
  author = {Ludovic Tuncay and Etienne Labbé and Emmanouil Benetos and Thomas Pellegrini},
  journal= {arXiv preprint arXiv:2507.02915},
  year   = {2025}
}