超越视频到音效:环境感知语音的视频转音频合成
声音
2025-09-22 v1 多媒体
音频与语音处理
摘要
生成逼真且上下文感知的音频在现实应用中至关重要,例如视频游戏开发。虽然现有的视频转音频 (V2A) 方法主要关注音效生成,但难以产生可理解的语音。而且,当前的环境语音合成方法仍基于文本,无法与动态视频内容实现时序对齐。本文提出了超越视频到音效 (BVS) 方法,用于为给定视频生成带环境感知的可理解语音的同步音频。我们引入两种建模方法:(1) 第一阶段是视频引导的音频语义 (V2AS) 模型,用于基于语音提示预测统一的音频语义标记;(2) 第二阶段是视频条件的语义到声学 (VS2A) 模型,用于将语义标记细化为详细的声学标记。实验表明,BVS 在视频转上下文感知语音合成和沉浸式音频背景转换等场景中有效,消融研究进一步验证了我们的设计。我们的演示可在链接访问。
引用
@article{arxiv.2509.15492,
title = {Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech},
author = {Xinlei Niu and Jianbo Ma and Dylan Harper-Harris and Xiangyu Zhang and Charles Patrick Martin and Jing Zhang},
journal= {arXiv preprint arXiv:2509.15492},
year = {2025}
}