FoleyDirector:基于结构化脚本的视频到音频生成的细粒度时序引导
声音
2026-04-21 v2 计算机视觉与模式识别
摘要
最近的视频到音频(V2A)方法取得了显著进展,使能够合成真实、高质量的音频。但它们在多事件场景或视觉线索不足时(如小区域、非视野声音、遮挡或部分可见物体)难以实现细粒度时序控制。本文提出了 FoleyDirector,首次实现了基于 DiT 的 V2A 生成的精确时序指导,同时保持基础模型的音频质量,并允许无缝切换 V2A 生成和时序受控合成。FoleyDirector 引入了结构化时序脚本(STS),对应短时序片段,提供更丰富的时序信息。这些特征通过脚本引导时序融合模块集成,其中采用时序脚本注意力进行一致性融合。为处理复杂的多事件场景,我们进一步提出了双帧声合成,实现帧内和帧外音频的并行生成,提高了可控性。为支持训练和评估,我们构建了 DirectorSound 数据集,引入了 VGGSoundDirector 和 DirectorBench。实验表明,FoleyDirector 在保持高音频保真度的同时,显著增强了时序可控性,使用户能够成为无线指导者,推动 V2A 向更具表达性和可控性的生成方向发展。
引用
@article{arxiv.2603.19857,
title = {FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts},
author = {You Li and Dewei Zhou and Fan Ma and Fu Li and Dongliang He and Yi Yang},
journal= {arXiv preprint arXiv:2603.19857},
year = {2026}
}
备注
Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, 18 pages