中文

FoleySpace:面向视觉对齐的立体声空间音频生成

声音 2025-08-22 v2

摘要

近期随着 AIGC 的发展,基于深度学习的视频到音频(video-to-audio, V2A)技术受到广泛关注。然而,现有研究大多聚焦于单声道音频生成,缺乏空间感知,而立体声空间音频生成技术的探索则不足。为解决此问题,我们提出了 FoleySpace,一个用于视频到立体声音频生成的框架,生成的音频在视觉指导下具有沉浸感且在空间上具有一致性。具体而言,我们开发了一种 sound source estimation 方法,以确定每个视频帧中声源的 2D 坐标与深度,然后采用坐标映射机制将 2D 源位置转换为 3D 轨迹。这一 3D 轨迹联合由预训练 V2A 模型生成的单声道音频作为条件输入,喂入扩散模型以生成在空间上一致的立体声音频。为支持动态声场的生成,我们构建了一个基于记录的头相关脉冲响应(Head-Related Impulse Responses, HRIR)的训练数据集,包含 various sound source movement scenarios。实验结果表明,所提方法在空间感知一致性方面优于现有方法,有效提升了音视频体验的沉浸质量。

关键词

引用

@article{arxiv.2508.12918,
  title  = {FoleySpace: Vision-Aligned Binaural Spatial Audio Generation},
  author = {Lei Zhao and Rujin Chen and Chi Zhang and Xiao-Lei Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2508.12918},
  year   = {2025}
}