ViSAGe:视频到空间音频生成
声音
2025-06-17 v1 人工智能
音频与语音处理
摘要
空间音频对于增强音视频体验的沉浸感至关重要,但其制作通常需要复杂的录音系统和专业知识。在本工作中,我们解决了一个新问题:直接从无声视频生成一阶全向声(一种广泛使用的空间音频格式)。为支持该任务,我们引入了 YT-Ambigen,一个包含 102K 个 5 秒 YouTube 视频片段及其对应一阶全向声的数据集。我们还提出了基于音频能量图和显著性度量的新评估指标,用于评估生成音频的空间特性。此外,我们提出了视频到空间音频生成(ViSAGe),一个端到端框架,通过利用 CLIP 视觉特征以及结合方向性和视觉引导的自回归神经音频编解码器,从无声视频帧生成一阶全向声。实验结果表明,ViSAGe 产生了合理且连贯的一阶全向声,优于由视频到音频生成和音频空间化组成的两阶段方法。定性示例进一步说明 ViSAGe 生成的与时间对齐的高质量空间音频能够适应视角变化。
引用
@article{arxiv.2506.12199,
title = {ViSAGe: Video-to-Spatial Audio Generation},
author = {Jaeyeon Kim and Heeseung Yun and Gunhee Kim},
journal= {arXiv preprint arXiv:2506.12199},
year = {2025}
}
备注
ICLR 2025. Project page: https://jaeyeonkim99.github.io/visage/