StereoFoley:来自视频的面向对象立体音频生成
声音
2026-04-21 v4 多媒体
音频与语音处理
摘要
我们提出了 StereoFoley,一个视频到音频生成框架,能够生成语义对齐、时间同步且空间准确的 48 kHz 立体声。虽然近期的生成式视频到音频模型在语义和时间保真度方面表现强劲,但它们大多仍局限于单声道或无法提供面向对象的立体声成像,这受限于缺乏专业混合、空间准确的视频到音频数据集。首先,我们开发了一个基础模型,能够从视频生成立体声,在语义准确性和同步性方面达到了最先进的 V2A 模型的性能水平。接下来,为了克服数据集限制,我们引入了一个合成数据生成流水线,结合视频分析、对象跟踪和音频合成,以及动态平移和基于距离的音量控制,从而实现空间准确的面向对象的声音。最后,我们在这一合成数据集上微调了基础模型,产生了清晰的对象-音频对应关系。由于没有既定的指标,我们引入了一个立体声对象感知指标,并将其与人类听音研究一起报告;这两项评估表现出了一致的趋势。这项工作建立了首个端到端的面向对象立体声视频到音频生成框架,解决了该领域的关键空白。
引用
@article{arxiv.2509.18272,
title = {StereoFoley: Object-Aware Stereo Audio Generation from Video},
author = {Tornike Karchkhadze and Kuan-Lin Chen and Mojtaba Heydari and Robert Henzel and Alessandro Toso and Mehrez Souden and Joshua Atkins},
journal= {arXiv preprint arXiv:2509.18272},
year = {2026}
}
备注
Accepted to ICASSP 2026