中文

LiON-LoRA:重新思考 LoRA 融合以统一可控空间与时间生成

计算机视觉与模式识别 2025-07-09 v1

摘要

视频扩散模型 (VDM) 通过从大规模数据中学习 demonstrating 在合成逼真的视频方面显示出惊人的能力。虽然基础低秩适应 (LoRA) 可以学习特定的空间或时间运动来驱动 VDM,但由于融合不稳定和非线性可扩展性,实现对相机轨迹和物体运动的精确控制仍然具有挑战性。为解决这些问题,我们提出了 LiON-LoRA,一个重新思考 LoRA 融合的新框架,通过三个核心原则实现:线性可扩展性、正交性和范数一致性。首先,我们分析了浅层 VDM 层中 LoRA 特征的正交性,实现低层可控性的解耦。其次,通过在复杂相机运动组合期间跨层强制范数一致性,以稳定融合。第三,集成一个可控 token 进入扩散转换器 (DiT),通过修改的自注意力机制线性调整相机和物体的运动幅度,以确保解耦控制。此外,我们通过利用静态相机视频将 LiON-LoRA 扩展到时间生成,统一了空间和时间可控性。实验表明,LiON-LoRA 在轨迹控制精度和运动强度调整方面超越了最先进的方法,仅用最小训练数据即可实现卓越的泛化。项目页面: https://fuchengsu.github.io/lionlora.github.io/

关键词

引用

@article{arxiv.2507.05678,
  title  = {LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion},
  author = {Yisu Zhang and Chenjie Cao and Chaohui Yu and Jianke Zhu},
  journal= {arXiv preprint arXiv:2507.05678},
  year   = {2025}
}