中文

针对音频的合成模式预训练

音频与语音处理 2024-10-02 v1 人工智能 计算机视觉与模式识别

摘要

本文提出使用合成模式而非真实音频数据进行预训练音频编码器。我们提出的框架包含两个关键要素。第一个要素是 Masked Autoencoder(MAE),这是一种自监督学习框架,通过从随机遮盖的版本中恢复数据来学习。MAE 倾向于关注数据中低层次信息,例如视觉模式和规律性。在 MAE 看来,输入中呈现什么内容并不重要,这可能是图像、音频 mel 频谱图,甚至是合成模式。这导致第二个关键要素的出现,即合成数据。与真实音频不同,合成数据免于隐私和许可侵权问题。通过将 MAE 与合成模式相结合,我们的框架可以在不使用真实数据的情况下学习通用特征表示,同时解决与真实音频相关的各种问题。为评估我们框架的有效性,我们在 13 个音频任务和 17 个合成数据集上进行了大量实验。实验提供了关于哪些类型的合成模式对音频有效的见解。我们的结果表明,我们的框架在预训练 AudioSet-2M 的模型性能方面表现与之相当,并在部分情况下超越基于图像的预训练方法。

关键词

引用

@article{arxiv.2410.00511,
  title  = {Pre-training with Synthetic Patterns for Audio},
  author = {Yuchi Ishikawa and Tatsuya Komatsu and Yoshimitsu Aoki},
  journal= {arXiv preprint arXiv:2410.00511},
  year   = {2024}
}

备注

Submitted to ICASSP'25