CAFA:可控自动音效艺术家
声音
2025-04-18 v3 音频与语音处理
摘要
音效是视频制作中的关键要素,指为静音视频添加音频信号并确保语义和时间对齐。在最近几年中,个性化内容创建的兴起以及自动视频转音频模型的进步增加了用户控制在该过程中更大的需求。一种可能的方法是纳入文本以指导音频生成。虽然已支持现有方法,但在确保多模态之间的兼容性方面仍存在挑战,特别是当文本引入额外信息或与视觉中自然推断的声音相矛盾时。本文介绍了 CAFA(可控自动音效艺术家),一种视频-文本-音频模型,为给定视频生成语义和时间对齐的音频,由文本输入指导。CAFA 基于文本转音频模型,并通过一种模态适配器机制集成视频信息。通过纳入文本,用户可以细化语义细节并引入创造性变体,引导音频合成超出预期的视频情境线索。实验表明,除了在语义对齐和音视频同步方面表现优异之外,该方法还实现了高文本可控性,证明了主观和客观评估。
引用
@article{arxiv.2504.06778,
title = {CAFA: a Controllable Automatic Foley Artist},
author = {Roi Benita and Michael Finkelson and Tavi Halperin and Gleb Sterkin and Yossi Adi},
journal= {arXiv preprint arXiv:2504.06778},
year = {2025}
}
备注
Renamed paper to "CAFA: a Controllable Automatic Foley Artist" from "Controllable Automatic Foley Artist". Updated link to demo page