中文

AVControl:高效训练音频-视觉控制的框架

计算机视觉与模式识别 2026-03-27 v1 多媒体 声音

摘要

控制视频和音频生成需要多样化的模态,从深度和姿态到摄像机轨迹和音频转换,但现有方法要么训练单个单体模型以固定的控制集,要么为每个新模态引入高昂的架构更改。我们引入AVControl,一个轻量、可扩展的框架,基于LTX-2,一个联合音频-视觉基础模型,其中每个控制模态作为独立的LoRA训练,位于并行画布上,该画布在注意力层中提供参考信号作为额外标记,仅需LoRA适配器本身之外的任何架构更改。我们展示,仅仅将基于图像的原语方法扩展到视频对于结构控制失败,our并行画布方法解决了这一问题。在VACE基准上,我们在深度和姿态引导的生成、inpainting和outpainting中超越了所有评估的基线,在摄像机控制和音频-视觉基准上取得竞争的结果。我们的框架支持一套独立训练的模态:包括深度、姿态和边缘等空间对齐控制、带有内参的摄像机轨迹、稀疏运动控制、视频编辑,以及据称是第一个为联合生成模型提供模块化音频-视觉控制。我们的方法既计算上也数据上高效:每个模态仅需小数据集,并在几百到几千个训练步骤内收敛,这是单体方法预算的少数。我们公开了代码和训练好的LoRA检查点。

引用

@article{arxiv.2603.24793,
  title  = {AVControl: Efficient Framework for Training Audio-Visual Controls},
  author = {Matan Ben-Yosef and Tavi Halperin and Naomi Ken Korem and Mohammad Salama and Harel Cain and Asaf Joseph and Anthony Chen and Urska Jelercic and Ofir Bibi},
  journal= {arXiv preprint arXiv:2603.24793},
  year   = {2026}
}

备注

Project page: https://matanby.github.io/AVControl/