$^R$FLAV:用于无限音视频生成的滚动流匹配
计算机视觉与模式识别
2025-03-13 v2
摘要
联合音视频(AV)生成仍是生成式AI中的重大挑战,主要涉及三个关键要求:生成样本的质量、无缝的多模态同步和时间一致性,使音频轨迹与视觉数据相匹配,反之亦然,以及无限视频时长。本文提出了-FLAV,一种新型基于变换器的架构,旨�解决AV生成的所有关键挑战。我们探索了三种不同的跨模态交互模块,其中我们轻量级的时序融合模块被证明是最有效且计算效率最高的用于对齐音频和视觉模态的方法。我们的实验结果表明,-FLAV 在多模态AV生成任务中优于现有的领先模型。我们的代码和模型权重已发布于 https://github.com/ErgastiAlex/R-FLAV。
引用
@article{arxiv.2503.08307,
title = {$^R$FLAV: Rolling Flow matching for infinite Audio Video generation},
author = {Alex Ergasti and Giuseppe Gabriele Tarollo and Filippo Botti and Tomaso Fontanini and Claudio Ferrari and Massimo Bertozzi and Andrea Prati},
journal= {arXiv preprint arXiv:2503.08307},
year = {2025}
}