中文

Read, Watch and Scream! 从文本和视频生成声音

计算机视觉与模式识别 2024-12-30 v2 多媒体 声音 音频与语音处理

摘要

尽管多模态生成模型取得了显著进展,视频到音频生成仍面临性能有限和灵活性不足的挑战——后者限制了对特定场景中特定对象的声音合成优先级。相反,文本到音频生成方法可产生高质量音频,但在确保场景全面描绘和时间可变控制方面存在挑战。为解决这些挑战,我们提出一种新型的视频-文本到音频生成方法,称为\ours,其中视频作为文本到音频生成模型的条件控制。尤其是,我们从视频中估计声音结构信息(即能量),同时从用户提示中获取关键内容线索。我们采用表现良好的文本到音频模型来整合视频控制,这对于使用大规模三元组(音频-视频-文本)数据训练多模态扩散模型更为高效。此外,通过分离音频的生成组件,使系统更具灵活性,用户可根据个人偏好自由调整能量、周围环境和主要声源。实验结果表明,我们的方法在质量、可控性和训练效率方面均表现出优越性。代码和演示已公开于https://naver-ai.github.io/rewas。

关键词

引用

@article{arxiv.2407.05551,
  title  = {Read, Watch and Scream! Sound Generation from Text and Video},
  author = {Yujin Jeong and Yunji Kim and Sanghyuk Chun and Jiyoung Lee},
  journal= {arXiv preprint arXiv:2407.05551},
  year   = {2024}
}

备注

AAAI2025, Project page: https://naver-ai.github.io/rewas