中文

作为掩码音视频学习器的扩散模型

声音 2024-01-08 v2 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

过去几年中,音频与视觉信号之间的同步性被用于学习更丰富的音视频表示。借助大量可用的无标签视频,许多无监督训练框架已在各类下游音频与视频任务中展现出令人印象深刻的成果。近来,掩码音视频学习器(MAViL)已成为一种最先进的音视频预训练框架。MAViL 将对比学习与掩码自编码相结合,通过融合来自两种模态的信息来联合重建音频谱图与视频帧。本文研究了扩散模型与 MAViL 之间的潜在协同效应,力求从这两个框架中获得互利。将扩散引入 MAViL,并结合包括使用掩码比例课程与自适应批大小在内的多种训练效率方法,使得预训练浮点运算数(FLOPS)显著降低 32%,预训练挂钟时间减少 18%。关键在于,与 MAViL 的性能相比,这一效率提升并未损害模型在下游音频分类任务中的表现。

关键词

引用

@article{arxiv.2310.03937,
  title  = {Diffusion Models as Masked Audio-Video Learners},
  author = {Elvis Nunez and Yanzi Jin and Mohammad Rastegari and Sachin Mehta and Maxwell Horton},
  journal= {arXiv preprint arXiv:2310.03937},
  year   = {2024}
}

备注

Camera-ready version for the Machine Learning for Audio Workshop at NeurIPS 2023