中文

WavJEPA:语义学习为原始波形提供稳健音频基础模型

声音 2025-11-11 v3 音频与语音处理

摘要

从原始波形学习音频表示克服了频谱图基于音频表示学习的关键局限性,如频谱图计算的长延迟以及相位信息的丢失。然而,尽管从原始波形进行自监督语音表示学习取得了显著成功,这些方法尚未实现类似的成就于通用音频表示学习。本文我们提出WavJEPA,即联合嵌入预测架构的波形版本。WavJEPA利用高级语义表示学习来解决在语音单元或标记级别进行表示学习的不足。我们展示了该方法在广泛的下游基准任务中显著优于最先进的时间域音频基础模型,同时需要大量计算资源。此外,为克服时间域模型在噪声和回声的真实环境声学环境中通常出现的性能下降,我们提出了WavJEPA-Nat。WavJEPA-Nat是WavJEPA架构的一个多通道扩展,训练于模拟的自然场景。我们发现WavJEPA-Nat对回声和噪声具有高度鲁棒性。这些结果突显了从原始波形进行通用音频表示学习的可行性和计算效率,展示了面向实际应用的低延迟、稳健的时间域音频基础模型的潜力。

关键词

引用

@article{arxiv.2509.23238,
  title  = {WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms},
  author = {Goksenin Yuksel and Pierre Guetschel and Michael Tangermann and Marcel van Gerven and Kiki van der Heijden},
  journal= {arXiv preprint arXiv:2509.23238},
  year   = {2025}
}

备注

Still under review