中文

掩码建模二人组:通过鼓励双网络建模输入来学习表示

音频与语音处理 2023-03-03 v3 计算机视觉与模式识别 机器学习 声音

摘要

掩码自编码器是一种简单而强大的自监督学习方法。然而,它通过重构被掩码的输入块来间接学习表示。有几种方法通过预测被掩码块的表示来直接学习表示;但是,我们认为使用所有块来编码训练信号表示是次优的。我们提出了一种新方法,掩码建模二人组(M2D),该方法直接学习表示,同时仅使用被掩码块获取训练信号。在 M2D 中,在线网络编码可见块并预测被掩码块的表示,而目标网络(一个动量编码器)编码被掩码块。为了更好地预测目标表示,在线网络应该对输入进行良好建模,而目标网络也应该对输入进行良好建模以与在线预测保持一致。这样,学习到的表示应该能更好地建模输入。我们通过学习通用音频表示验证了 M2D,并且 M2D 在 UrbanSound8K、VoxCeleb1、AudioSet20K、GTZAN 和 SpeechCommandsV2 等任务上取得了新的 SOTA 性能。我们在附录中使用 ImageNet-1K 进一步验证了 M2D 在图像上的有效性。

关键词

引用

@article{arxiv.2210.14648,
  title  = {Masked Modeling Duo: Learning Representations by Encouraging Both Networks to Model the Input},
  author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2210.14648},
  year   = {2023}
}

备注

6 pages, 3 figures, and 6 tables. To appear at ICASSP2023