Frieren:基于整流流匹配的高效视频到音频生成网络
声音
2025-01-07 v4 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
视频到音频(V2A)生成旨在从无声视频中合成内容匹配的音频,而构建具有高生成质量、效率和视听时间同步性的V2A模型仍然具有挑战性。我们提出Frieren,一种基于整流流匹配的V2A模型。Frieren通过直线路径将条件传输向量场从噪声回归到频谱图潜在空间,并通过求解常微分方程进行采样,在音频质量上优于自回归和基于分数的模型。通过采用基于前馈Transformer的非自回归向量场估计器和具有强时间对齐的通道级跨模态特征融合,我们的模型生成的音频与输入视频高度同步。此外,通过再流和带引导向量场的单步蒸馏,我们的模型可以在少数甚至仅一个采样步骤中生成高质量的音频。实验表明,Frieren在VGGSound数据集上的生成质量和时间对齐方面均达到了最先进的性能,对齐准确率达到97.22%,初始分数比基于强扩散的基线提高了6.2%。音频样本可在http://frieren-v2a.github.io获取。
引用
@article{arxiv.2406.00320,
title = {Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching},
author = {Yongqi Wang and Wenxiang Guo and Rongjie Huang and Jiawei Huang and Zehan Wang and Fuming You and Ruiqi Li and Zhou Zhao},
journal= {arXiv preprint arXiv:2406.00320},
year = {2025}
}
备注
accepted by NeurIPS 2024