中文

ReelWave:通过多模态 LLM 对话实现多智能体电影声音生成

声音 2025-06-03 v3 计算机视觉与模式识别

摘要

当前以文本或视频为条件的音频生成侧重于将音频与文本/视频模态对齐。尽管对齐效果优异,但这些多模态框架仍无法直接应用于涉及多个场景的引人入胜的电影叙事,其中“屏幕内”声音需要时间对齐的音频生成,而“屏幕外”声音则用于在适当时提供伴随背景音乐的合适环境音。受专业电影制作启发,本文提出了一个由自主声音导演智能体监督的多智能体音频生成框架,该智能体通过多模态 LLM 与其他智能体进行多轮对话,以生成屏幕内和屏幕外声音。为解决屏幕内声音生成问题,在检测到视频中有人说话后,我们通过训练一个预测模型来捕捉语义和时间上同步的声音,该模型预测可解释的、随时间变化的音频控制信号:响度、音调和音色,拟音师智能体使用这些信号来调节声音生成中的交叉注意力模块。拟音师与作曲家和配音演员智能体协同工作,共同自主生成屏幕外声音以补充整体制作。每个智能体承担类似于电影制作团队中成员的具体角色。为了在时间上锚定音频语言模型,在 ReelWave 中,文本/视频条件被分解为与视觉内容同步(在适用时)的原子化、特定的声音生成指令。因此,我们的框架能够以从电影中提取的视频片段为条件,生成丰富且相关的音频内容。

关键词

引用

@article{arxiv.2503.07217,
  title  = {ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation},
  author = {Zixuan Wang and Chi-Keung Tang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2503.07217},
  year   = {2025}
}

备注

Project page: https://vincent2311.github.io/ReelWave_demo