中文

从视觉到音频及更广领域:用于视听表示与生成的统一模型

多媒体 2024-10-01 v1 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

视频同时包含视觉和听觉数据,创造了两种模态相互补充的感知丰富体验。因此,视频是研究音频与视觉元素之间相互作用的一种有价值的媒体。以往对视听模态的研究主要集中在视听表示学习或以一者条件化另一者的生成建模上,导致这两个分支之间存在脱节。能够同时学习表示并生成模态的统一框架尚未被开发。在本工作中,我们引入了一个名为 Vision to Audio and Beyond (VAB) 的新框架,以弥合视听表示学习与视觉到音频生成之间的鸿沟。VAB 的核心方法在于,它不直接处理原始视频帧和音频数据,而是在潜在空间内进行表示学习和生成建模。具体而言,VAB 使用预训练的音频分词器和图像编码器分别获取音频词元和视觉特征。随后,它执行视觉条件化的掩码音频词元预测这一预训练任务。这种训练策略使模型能够进行上下文学习以及同步的视频到音频生成。在预训练阶段之后,VAB 采用迭代解码方法,在视觉特征条件下快速生成音频词元。由于 VAB 是一个统一模型,其骨干网络可针对各种视听下游任务进行微调。我们的实验展示了 VAB 从视频生成高质量音频的效率,以及其获取语义视听特征的能力,并在视听检索与分类中取得了有竞争力的结果。

关键词

引用

@article{arxiv.2409.19132,
  title  = {From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation},
  author = {Kun Su and Xiulong Liu and Eli Shlizerman},
  journal= {arXiv preprint arXiv:2409.19132},
  year   = {2024}
}

备注

Accepted by ICML 2024