A-JEPA:联合嵌入预测架构可以听
声音
2024-01-12 v3 计算机视觉与模式识别
音频与语音处理
摘要
本文表明,驱动大型基础视觉模型成功的掩码建模原理可通过在潜空间中进行预测而有效应用于音频。我们引入基于音频的联合嵌入预测架构(A-JEPA),一种从音频频谱进行自监督学习的简单扩展方法。遵循 I-JEPA 的设计,我们的 A-JEPA 通过上下文编码器以课程掩码策略编码可见音频频谱块,并预测在精心设计位置处采样区域的表示。这些区域的目标表示由上下文编码器的指数移动平均(即目标编码器)在整个频谱上提取。我们发现,考虑到音频频谱图在局部时间与频率上高度相关的复杂性,将随机块掩码以课程方式转化为时频感知掩码是有益的。为增强上下文语义理解与鲁棒性,我们在目标数据集上以正则化掩码微调编码器,而非输入丢弃或置零。经验上,当使用 Vision Transformers 结构构建时,我们发现 A-JEPA 具有高度可扩展性,并在多个音频与语音分类任务上刷新了最先进(SOTA)性能,优于其他使用外部监督预训练的近期模型。
引用
@article{arxiv.2311.15830,
title = {A-JEPA: Joint-Embedding Predictive Architecture Can Listen},
author = {Zhengcong Fei and Mingyuan Fan and Junshi Huang},
journal= {arXiv preprint arXiv:2311.15830},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2207.06405 by other authors