聆听所需之声!文本条件选择性视频转音频生成
计算机视觉与模式识别
2026-03-30 v2 机器学习
多媒体
声音
音频与语音处理
摘要
本工作提出一种新任务,即文本条件选择性视频转音频(video-to-audio, V2A)生成,产生用户意图的特定声音,而非多目标视频中的全部声音。这一能力在多媒体制作中尤为关键,因为音频轨道需要针对每个声源单独处理,以实现精确的编辑、混合和创意控制。我们提出了 SELVA(Selective video-to-audio),一种新型文本条件 V2A 模型,将文本提示作为显式选择器,以从视频编码器中提取与提示相关的声源视觉特征。为抑制文本无关激活,采用高效的视频编码器微调,辅助标记促进跨注意力,实现稳健的语义和时序对齐。SELVA 还采用自监督方式的自主视频混合方案,以克服单声道音频轨道监督不足的限制。我们在 VGG-MONOAUDIO 上对 SELVA 进行评估,该数据集是为此任务精选的干净单源视频基准。大量实验和消融实验一致证明其在音频质量、语义对齐和时序同步方面的有效性。
引用
@article{arxiv.2512.02650,
title = {Hear What Matters! Text-conditioned Selective Video-to-Audio Generation},
author = {Junwon Lee and Juhan Nam and Jiyoung Lee},
journal= {arXiv preprint arXiv:2512.02650},
year = {2026}
}
备注
accepted to CVPR 2026