中文

Tri-Ergon:基于多模态条件和LUFS控制的粗粒度视频到音频生成

计算机视觉与模式识别 2024-12-31 v1 多媒体 声音 音频与语音处理

摘要

视频到音频 (V2A) 生成利用视频的视觉特征生成与场景相对应的真实声音。然而,当前的V2A模型往往缺乏对生成音频细粒度控制,尤其是在音量变化和多模态条件的融合方面。为克服这些限制,我们引入Tri-Ergon,一种基于扩散的V2A模型,融合文本、听觉和像素级视觉提示,以实现详细且语义丰富的音频合成。此外,我们引入相对完全尺度音量单位 (LUFS) 嵌入,允许对单个音频通道的时间内音量变化进行精确手动控制,使我们的模型有效地解决了视频和音频在真实Foley工作流程中的复杂关联。Tri-Ergon能够创建44.1 kHz 高保真立体声音频片段,长度可达60秒,显著优于通常仅生成固定时长单声道音频的最先进V2A方法。

关键词

引用

@article{arxiv.2412.20378,
  title  = {Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control},
  author = {Bingliang Li and Fengyu Yang and Yuxin Mao and Qingwen Ye and Hongkai Chen and Yiran Zhong},
  journal= {arXiv preprint arXiv:2412.20378},
  year   = {2024}
}

备注

AAAI 2025 Accepted