SoundReactor:基于帧的在线视频到音频生成
声音
2025-10-03 v1 机器学习
音频与语音处理
摘要
现有的视频到音频(Video-to-Audio,V2A)生成模型 operate offline,假设事先获取整个视频序列或若干帧,这严重限制了其在交互式应用(如实时内容创建和新兴生成式世界模型)中的使用。为此,我们提出帧级在线 V2A 生成的新任务,即模型在无需访问未来视频帧的情况下自回归生成音频。进一步,我们提出 SoundReactor,据称是该任务下首个简单而有效的框架。我们的设计强制实现端到端因果性,目标在每帧延迟上实现音画同步。模型主干是基于连续音频潜变量的解码器-only 因果变换器。对于视觉条件,采用最小变体的 DINOv2 视觉编码器提取的网格(patch)特征,这些特征被聚合为每帧的单个 token,以维持端到端的因果性和效率。模型通过扩散预训练再一致性微调进行训练,以加速扩散头解码。我们在来自 AAA 标题的多样化游戏视频基准上,成功生成语义和时间上对齐的高质量全频段立体声音频,经客观和人类评估均得到验证。此外,我们的模型在 30FPS、480p 视频上实现了低每帧波形级延迟(head NFE=1 时为 26.3ms,NFE=4 时为 31.5ms),仅使用单个 H100。演示样本可在 https://koichi-saito-sony.github.io/soundreactor/ 查看。
引用
@article{arxiv.2510.02110,
title = {SoundReactor: Frame-level Online Video-to-Audio Generation},
author = {Koichi Saito and Julian Tanke and Christian Simon and Masato Ishii and Kazuki Shimada and Zachary Novack and Zhi Zhong and Akio Hayakawa and Takashi Shibuya and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2510.02110},
year = {2025}
}