中文

探究通用音频表示学习中联合嵌入预测架构的设计选择

声音 2024-05-15 v1 人工智能 机器学习 音频与语音处理

摘要

本文研究自监督通用音频表示学习问题。我们探索了将联合嵌入预测架构用于此任务,该架构包括将输入的 mel 频谱图分为两部分(上下文和目标),为每部分计算神经表示,并训练神经网络从上下文表示预测目标表示。我们研究了该框架内的几个设计选择,并通过在各种音频分类基准上评估我们的模型来研究它们的影响,包括环境声音、语音和音乐下游任务。我们特别关注输入数据的哪一部分被用作上下文或目标,并通过实验表明它显著影响模型的质量。具体而言,我们注意到在图像领域有效的一些设计选择在音频上表现不佳,从而突显了这两种模态之间的重大差异。

关键词

引用

@article{arxiv.2405.08679,
  title  = {Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning},
  author = {Alain Riou and Stefan Lattner and Gaëtan Hadjeres and Geoffroy Peeters},
  journal= {arXiv preprint arXiv:2405.08679},
  year   = {2024}
}

备注

Self-supervision in Audio, Speech and Beyond workshop, IEEE International Conference on Acoustics, Speech, and Signal Processing, 2024