中文

基于 per-reference-video LoRA 的统一语义控制视频生成

计算机视觉与模式识别 2026-04-02 v3

摘要

实现语义条件下跨多样视频生成的语义对齐仍是重要挑战。依赖显式结构引导的方法往往强加刚性空间约束,限制了语义灵活性;而为单一控制类型设计的模型缺乏互操作性和适应性。这类设计瓶颈阻碍了灵活高效语义视频生成的进展。为此,我们提出 Video2LoRA,一个可扩展且通用的语义控制视频生成框架,基于参考视频进行条件化。Video2LoRA 使用轻量级超网络预测每个语义输入的个性化 LoRA 权重,这些权重与辅助矩阵组合形成集成到冻结扩散骨干网络中的自适应 LoRA 模块。该设计使模型能够在保持关键风格和内容变体的同时,生成与参考语义一致的视频,无需进行任何 per-condition 训练。值得注意的是,最终模型权重不足 150MB,存储与部署高度高效。Video2LoRA 在多样条件下实现语义一致生成,表现出强大的零样本对 unseen semantics 的泛化能力。

关键词

引用

@article{arxiv.2603.08210,
  title  = {Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA},
  author = {Zexi Wu and Baolu Li and Jing Dai and Yiming Zhang and Yue Ma and Qinghe Wang and Xu Jia and Hongming Xu},
  journal= {arXiv preprint arXiv:2603.08210},
  year   = {2026}
}

备注

10 pages