中文

StereoSync:基于视频的空间感知立体声音频生成

声音 2025-10-08 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

虽然音频生成在近年来得到了广泛研究,但视频对齐音频生成仍然是相对未被探索的前沿领域。为填补这一差距,我们引入了 StereoSync,一种新型且高效的模型,用于生成与参考视频在时间上同步且在视觉语境中空间对齐的音频。此外,StereoSync 还通过利用预训练基础模型实现了效率,减少了对大量训练的需求,同时保持高质量的合成效果。不同于现有方法主要关注时间同步,StereoSync 通过将空间感知性质地引入视频对齐音频生成,实现了重大突破。具体而言,给定输入视频,本方法从深度图和边界框中提取空间线索,将其作为扩散式音频生成模型的跨注意力条件。这种方法使 StereoSync 能够超越简单的同步,生成动态适应视频场景空间结构和运动的立体声音频。我们在 Walking The Maps 数据集上评估了 StereoSync,该数据集包含来自视频游戏中 animated character walking through diverse environments 的视频。实验结果表明,StereoSync 能够实现时间和空间对齐,在视频到音频生成领域推动了技术发展,显著提升了沉浸式和逼真的音频体验。

关键词

引用

@article{arxiv.2510.05828,
  title  = {StereoSync: Spatially-Aware Stereo Audio Generation from Video},
  author = {Christian Marinoni and Riccardo Fosco Gramaccioni and Kazuki Shimada and Takashi Shibuya and Yuki Mitsufuji and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2510.05828},
  year   = {2025}
}

备注

Accepted at IJCNN 2025