FolAI:语义与时序对齐的同步 Foley 声音生成
声音
2025-05-06 v3 计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
传统的声效设计工作流程依赖于手动将音频事件与视觉线索对齐,正如 Foley 声效设计所示,其中日常动作如脚步声或物体互动被重现以匹配屏幕上的动作。该过程耗时、难以扩展,且缺乏能够保持创意意图的自动化工具。尽管近期在视觉到音频生成方面取得了进展,但从视频中产生时序连贯且语义可控的音效仍是一个主要挑战。为克服这些限制,我们引入FolAI,一个两阶段的生成框架,将声音合成的何时与什么解耦,即分别进行时序结构提取和语义引导生成。在第一阶段,我们从视频中估计出平滑的控制信号,捕捉时间上的运动强度和节奏结构,作为音频的时序框架。在第二阶段,扩散生成模型在该时序包络和由用户提供的高层语义嵌入向量(定义所需听觉内容,如材料或动作类型)的条件下生成声效。这种模块化设计使我们能够精确控制时序和时彩,既简化了重复性任务,又保留了专业 Foley 工作流程中的创意灵活性。结果表明,在多样化的视觉情境中(如脚步声生成和动作特定的声音化),我们的模型可靠地产生与视觉运动时序对齐、与用户意图语义一致且感知上真实的音频。这些发现凸显了FolAI作为可控且模块化的解决方案在专业和交互式环境中实现可扩展的高质量 Foley 声音合成的潜力。补充材料可在我们的专用演示页面https://ispamm.github.io/FolAI 上获取。
引用
@article{arxiv.2412.15023,
title = {FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment},
author = {Riccardo Fosco Gramaccioni and Christian Marinoni and Emilian Postolache and Marco Comunità and Luca Cosmo and Joshua D. Reiss and Danilo Comminiello},
journal= {arXiv preprint arXiv:2412.15023},
year = {2025}
}