Draw an Audio:利用多指令进行视频到音频合成
声音
2024-09-12 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
Foley 是电影制作中常用的术语,指为无声电影或视频添加日常音效以增强听觉体验。视频到音频 (V2A) 作为一种特殊的自动拟音任务,其固有挑战与视听同步相关。这些挑战包括保持输入视频与生成音频之间的内容一致性,以及视频内时间和响度属性的对齐。为了解决这些问题,我们构建了一个可控的视频到音频合成模型,名为 Draw an Audio,该模型通过绘制的掩码和响度信号支持多种输入指令。为确保合成音频与目标视频之间的内容一致性,我们引入了掩码注意力模块 (MAM),该模块利用掩码视频指令使模型能够聚焦于感兴趣区域。此外,我们实现了时间-响度模块 (TLM),该模块使用辅助响度信号以确保合成的声音在响度和时间维度上与视频对齐。此外,我们通过标注字幕提示,扩展了一个大规模 V2A 数据集,名为 VGGSound-Caption。在两个大规模 V2A 数据集上具有挑战性的基准测试上的大量实验验证了 Draw an Audio 达到了最先进的水平。项目页面:https://yannqi.github.io/Draw-an-Audio/。
引用
@article{arxiv.2409.06135,
title = {Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis},
author = {Qi Yang and Binjie Mao and Zili Wang and Xing Nie and Pengfei Gao and Ying Guo and Cheng Zhen and Pengfei Yan and Shiming Xiang},
journal= {arXiv preprint arXiv:2409.06135},
year = {2024}
}
备注
14 pages, 11 figures