中文

基于 MeanFlow 加速的多模态视频到音频的一键生成

声音 2025-09-09 v1 人工智能

摘要

合成静默视频中的音频存在一个根本性难题:合成质量与推理效率之间的内在权衡。例如,基于流匹配的模型依赖于建模瞬时速度,本质上需要迭代采样过程,导致推理速度较慢。为解决此效率瓶颈,我们引入基于 MeanFlow 加速的模型,该模型使用平均速度来表征流场,从而实现一键式生成,显著加快多模态视频到音频(VTA)合成的速度,同时保持音频质量、语义对齐和时间同步。此外,采用标量缩放机制,在应用无分类器引导(CFG)时平衡条件和无条件预测,从而有效缓解一键生成中的 CFG 引起的失真。由于音频合成网络与多模态条件共同训练,我们进一步对其进行文本到音频(TTA)合成任务的评估。实验结果表明,将 MeanFlow 纳入网络后,在 VTA 和 TTA 合成任务中显著提高了推理速度,而不会损害感知质量。

关键词

引用

@article{arxiv.2509.06389,
  title  = {MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation},
  author = {Xiaoran Yang and Jianxuan Yang and Xinyue Guo and Haoyu Wang and Ningning Pan and Gongping Huang},
  journal= {arXiv preprint arXiv:2509.06389},
  year   = {2025}
}