中文

Foley-Flow:基于掩码音视觉对齐与动态条件流的视频到音频协调生成

计算机视觉与模式识别 2026-03-10 v1 人工智能 机器学习 声音 音频与语音处理

摘要

基于视频输入的协调音频生成通常需要严格的音视频(AV)对齐, 即生成的音频片段的语义和节奏性都应与视频帧相对应。以往研究采用两阶段设计:首先通过对比学习对齐 AV 编码器, 然后由编码后的视频表示指导音频生成过程。我们观察到对比学习和全局视频引导在对齐整体 AV 语义方面有效, 但限制了在时序上的节奏同步。本文提出 FoleyFlow, 通过掩码建模训练首先对齐单模态 AV 编码器, 其中被掩码的音频片段在对应视频片段的指导下进行恢复。训练后, 仅使用单模态数据预训练的 AV 编码器在语义和节奏一致性方面得到对齐。随后, 我们开发了用于最终音频生成的动态条件流。基于高效速度流生成框架, 我们的动态条件流利用时变视频特征作为动态条件, 指导相应音频片段的生成。为此, 我们在掩码 AV 对齐期间提取连贯的语义和节奏表示, 并使用视频片段的此表示在时序上指导音频生成。我们的音频结果在标准基准测试上在多个指标上大幅超越现有结果。优异的性能表明 FoleyFlow 在生成与各种视频序列在语义和节奏性上都一致的协调音频方面有效。

关键词

引用

@article{arxiv.2603.08126,
  title  = {Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows},
  author = {Shentong Mo and Yibing Song},
  journal= {arXiv preprint arXiv:2603.08126},
  year   = {2026}
}