基于掩码自编码器的掩码谱图建模用于通用音频表征学习
音频与语音处理
2023-03-09 v1 声音
摘要
近期的通用音频表征在各种音频任务上展现出最先进的性能。这些表征通过自监督学习方法进行预训练,该方法从输入中创建训练信号。例如,典型的音频对比学习利用输入声音之间的时间关系来创建训练信号,而某些方法利用数据增强所创建输入视图之间的差异。然而,这些训练信号不提供源自完整输入声音的信息,我们认为这对于学习如实描述输入的表征是次优的。本文中,我们寻求利用掩码谱图块自编码这一 pretext 任务(掩码谱图建模(MSM,一种应用于音频谱图的掩码图像建模变体)),以输入自身作为监督来学习音频表征。为实现 MSM,我们使用掩码自编码器(MAE),一种图像自监督学习方法。MAE 学习将少量可见块高效编码为潜在表征,以携带用于重建大量掩码块的基本信息。在训练期间,MAE 最小化重建误差,该误差以输入作为训练信号,从而达成我们的目标。我们在 HEAR 2021 NeurIPS Challenge 的评测基准下使用 MAE 对我们的 MSM(MSM-MAE)模型进行了实验。我们的 MSM-MAE 模型在 15 个任务中的 7 个上优于 HEAR 2021 Challenge 的结果(例如,CREMA-D 上准确率 73.4%,LibriCount 上 85.8%),同时在专用模型表现更好的其他任务上展现出顶尖性能。我们还研究了 MSM-MAE 的设计选择如何影响性能,并对可视化结果进行定性分析以理解所学表征。我们在线公开了代码。
引用
@article{arxiv.2204.12260,
title = {Masked Spectrogram Modeling using Masked Autoencoders for Learning General-purpose Audio Representation},
author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2204.12260},
year = {2023}
}
备注
22 pages, 8 figures. Under the review process