中文

Foley Control: 将冻结的潜在文本到音频模型与视频对齐

计算机视觉与模式识别 2025-10-27 v1 声音

摘要

Foley Control是一种轻量级的视频引导拟音方法,它保持预训练的单模态模型冻结,仅学习它们之间一个小型的交叉注意力桥接。我们通过将紧凑的视频交叉注意力插入到模型现有的文本交叉注意力之后,将V-JEPA2视频嵌入连接到冻结的Stable Audio Open DiT文本到音频(T2A)模型,这样提示词设定全局语义,而视频则细化时序和局部动态。冻结的主干网络保留了强大的边缘分布(视频;给定文本的音频),而桥接则学习了同步所需的音频-视频依赖关系——无需重新训练音频先验。为了减少内存并稳定训练,我们在条件化之前对视频令牌进行池化。在精选的视频-音频基准测试中,Foley Control以远少于近期多模态系统的可训练参数,实现了具有竞争力的时序和语义对齐,同时保留了提示驱动的可控性和生产友好的模块化(无需端到端重新训练即可交换/升级编码器或T2A主干网络)。尽管我们专注于视频到拟音,但相同的桥接设计可能扩展到其他音频模态(例如语音)。

关键词

引用

@article{arxiv.2510.21581,
  title  = {Foley Control: Aligning a Frozen Latent Text-to-Audio Model to Video},
  author = {Ciara Rowles and Varun Jampani and Simon Donné and Shimon Vainer and Julian Parker and Zach Evans},
  journal= {arXiv preprint arXiv:2510.21581},
  year   = {2025}
}

备注

Project Page: https://stability-ai.github.io/foleycontrol.github.io/