掩码建模双子:迈向通用音频预训练框架
音频与语音处理
2024-04-10 v1 声音
摘要
使用掩码预测的自监督学习(SSL)在通用音频表示方面取得了长足进步。本研究提出了掩码建模双子(M2D),一种改进的掩码预测SSL,它通过预测作为训练信号的掩码输入信号的表示来学习。与传统方法不同,M2D仅对掩码部分进行编码以获取训练信号,从而鼓励M2D中的两个网络对输入进行建模。虽然M2D改进了通用音频表示,但实际应用(如工业和医疗领域)中专门化的表示是必不可少的。这些领域中通常属于机密和专有的数据一般规模较小,且分布与预训练数据集不同。因此,我们提出了M2D for X(M2D-X),将M2D扩展为能够针对应用X预训练专门化表示。M2D-X从M2D和额外任务中学习,并输入背景噪声。我们使额外任务可配置以服务于多样化的应用,而背景噪声有助于在小数据上学习,并构成一个使表示具有鲁棒性的去噪任务。通过这些设计选择,M2D-X应能学习到专门用于满足各种应用需求的表示。我们的实验证实,针对通用音频、专门用于竞争激烈的AudioSet和语音领域以及小数据医疗任务的表示均达到了顶级性能,展示了将我们的模型用作通用音频预训练框架的潜力。我们的代码已在 https://github.com/nttcslab/m2d 上公开供未来研究使用。
引用
@article{arxiv.2404.06095,
title = {Masked Modeling Duo: Towards a Universal Audio Pre-training Framework},
author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2404.06095},
year = {2024}
}
备注
15 pages, 6 figures, 15 tables. Accepted by TASLP