ViSAudio: 端到端视频驱动的双耳空间音频生成
计算机视觉与模式识别
2025-12-03 v1 人工智能
摘要
尽管视频到音频生成取得了进展,但该领域主要聚焦于单声道输出,缺乏空间沉浸感。现有的双耳方法仍受限于两阶段流水线,即首先生成单声道音频再进行空间化,这往往导致误差累积和时空不一致性。为解决这一局限,我们提出了从无声视频直接进行端到端双耳空间音频生成的任务。为支持该任务,我们构建了 BiAudio 数据集,包含约 97K 个视频-双耳音频对,涵盖多样化的真实场景和相机旋转轨迹,通过半自动化流水线构建。此外,我们提出了 ViSAudio,一个端到端框架,采用条件流匹配与双分支音频生成架构,其中两个专用分支分别建模音频潜流。该框架集成了条件时空模块,在平衡通道间一致性的同时保留独特的空间特征,确保音频与输入视频之间的精确时空对齐。全面实验表明,ViSAudio 在客观指标和主观评估上均优于现有最先进方法,能够生成高质量的双耳音频,具备空间沉浸感,并能有效适应视角变化、声源运动和多样化声学环境。项目网站:https://kszpxxzmc.github.io/ViSAudio-project.
引用
@article{arxiv.2512.03036,
title = {ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation},
author = {Mengchen Zhang and Qi Chen and Tong Wu and Zihan Liu and Dahua Lin},
journal= {arXiv preprint arXiv:2512.03036},
year = {2025}
}