AC-Foley:基于参考音频的无参考音频引导的视频到音频合成与声学传递
机器学习
2026-03-17 v1
摘要
现有的视频到音频(V2A)生成方法主要依赖文本提示配合视觉信息来合成音频。然而,仍存在两个关键瓶颈:训练数据中语义粒度不足,例如将声学上不同的声音合并到粗糙标签下;以及文本描述中存在语义模糊,难以精确描述微观声学特征。这些瓶颈使得使用文本控制模式进行精细的声音合成变得困难。为此,我们提出AC-Foley,一种基于参考音频的音频条件V2A模型,直接利用参考音频实现对生成声音的精确且细粒度的控制。该方法可实现精细声音合成、声纹传递、零样本声音生成以及 improved 音频质量。通过直接对音频信号进行条件化,我们的方法绕开了文本描述的语义歧义,同时实现了对声学属性的精确操控。实验上,AC-Foley 在参考音频条件下实现了视频到音频 Foley 生成的状态最佳性能,而在无音频条件化情况下仍与状态最佳的 V2A 方法保持竞争力。代码和演示可在:https://ff2416.github.io/AC-Foley-Page 访问。
引用
@article{arxiv.2603.15596,
title = {Robust and Computationally Efficient Linear Contextual Bandits under Adversarial Corruption and Heavy-Tailed Noise},
author = {Naoto Tani and Futoshi Futami},
journal= {arXiv preprint arXiv:2603.15596},
year = {2026}
}