Audio-JEPA:面向音频表征学习的联合嵌入预测架构
声音
2025-07-08 v1 人工智能
机器学习
音频与语音处理
信号处理
摘要
基于联合嵌入预测架构(JEPA)范式(一种最近的自监督学习框架,用于预测高层特征空间中掩码区域的潜在表征),我们提出了 Audio-JEPA(音频联合嵌入预测架构),专门针对音频数据定制。Audio-JEPA 使用简单的 Vision Transformer 骨干网络来预测掩码频谱图块的潜在表征,而不是重建原始音频。我们在未标注的 AudioSet 片段(10 秒,32kHz)上进行预训练,对梅尔频谱图进行随机块掩码。我们在涵盖语音、音乐和环境声音任务的 X-ARES 套件上进行评估。尽管我们的实现是将原始模型直接迁移到音频领域,但结果仍显示出与 wav2vec 2.0 和 data2vec 相当的性能,同时使用的训练数据不到它们的五分之一,且无需超参数调优。所有代码和预训练检查点将在 GitHub 上发布。
引用
@article{arxiv.2507.02915,
title = {Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning},
author = {Ludovic Tuncay and Etienne Labbé and Emmanouil Benetos and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2507.02915},
year = {2025}
}