中文

为电影制作中的电影场景合成微调开放视频生成器:基于LoRA和 Wan2.1 I2V 的小数据管线

计算机视觉与模式识别 2025-11-03 v1 人工智能

摘要

我们提出了一个实用的管线,用于微调开源视频扩散变换器以从小数据集合成电视和电影制作的电影场景。该管线采用两阶段过程,将视觉风格学习与运动生成解耦。在第一阶段,将 LoRA 模块集成到 Wan2.1 I2V-14B 模型的跨注意力层中,以适配来自阿伊·亚皮姆历史电视电影《埃尔·图尔科》的短片精选数据集,实现数小时内在单块 GPU 上的高效领域迁移。在第二阶段,微调后的模型产生具备风格一致性的关键帧,保留服装、灯光和色彩分级特征,然后通过模型的视频解码器在时间上扩展为连贯的 720p 序列。我们进一步应用轻量级并行化和序列分区策略以加速推理,同时不影响质量。通过 FVD、CLIP-SIM 和 LPIPS 指标的定量和定性评估,以及小规模的专业用户研究,均显示相较于基础模型在电影保真度和时间稳定性方面实现了可衡量的改进。完整的训练和推理管线已发布,以支持可重复性和跨电影领域的适配。

关键词

引用

@article{arxiv.2510.27364,
  title  = {Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V},
  author = {Meftun Akarsu and Kerem Catay and Sedat Bin Vedat and Enes Kutay Yarkan and Ilke Senturk and Arda Sar and Dafne Eksioglu},
  journal= {arXiv preprint arXiv:2510.27364},
  year   = {2025}
}

备注

video generation, image-to-video, dif- fusion transformer, LoRA, fine-tuning, cinematic scene synthesis, multi-GPU inference, fully sharded data parallelism, computational efficiency