中文

ThinkSound:基于多模态大语言模型的链条推理用于音频生成与编辑

音频与语音处理 2025-11-06 v3 计算机视觉与模式识别 声音

摘要

虽然端到端的视频到音频生成取得了很大进展,但产生能够真实捕捉视觉内容细微差别的高保真音频仍然具有挑战性。像从事创意行业的专业人士一样,这一生成过程需要对视觉动态、声学环境和时间关系等项目进行复杂的推理。我们提出了 ThinkSound,一种新型框架,利用链式推理(Chain-of-Thought, CoT)技术,使其能够实现视频音频的分步、交互式生成与编辑。我们的 метод 将整个过程分解为三个互补阶段:基础鲁尔夫生成(foundational foley generation)创建语义连贯的音景, 通过精确的用户交互实现的对象中心细化(interactive object-centric refinement),以及受自然语言指令引导的针对性编辑。在每个阶段,多模态大语言模型都会生成与上下文相匹配的 CoT 推理,以指导统一的音频基础模型。此外,我们引入了 AudioCoT 数据集,包含结构化的推理标注,建立了视觉内容、文本描述与声音合成之间的关联。实验表明,ThinkSound 在视频到音频生成任务中在音频指标和 CoT 指标方面均实现了状态最佳性能,并在超出分布的 Movie Gen Audio 测试基准中表现出色。项目页面可访问 https://ThinkSound-Project.github.io。

关键词

引用

@article{arxiv.2506.21448,
  title  = {ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing},
  author = {Huadai Liu and Kaicheng Luo and Jialei Wang and Wen Wang and Qian Chen and Zhou Zhao and Wei Xue},
  journal= {arXiv preprint arXiv:2506.21448},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025 Main