V-Warper: 通过值变形实现外观一致的视频扩散模型个性化
计算机视觉与模式识别
2025-12-16 v1
摘要
视频个性化旨在生成忠实地反映用户提供的主体并遵循文本提示的视频。然而,现有方法通常依赖大量的视频微调或大规模视频数据集,这带来了巨大的计算成本且难以扩展。此外,它们仍然难以在帧之间保持细粒度的外观一致性。为解决这些限制,我们引入了 V-Warper,一个用于基于 Transformer 的视频扩散模型的无训练粗到细个性化框架。该框架在不要求任何额外视频训练的情况下增强了细粒度的身份保真度。(1)一个轻量级的粗外观适应阶段仅利用少量参考图像,这些图像本就是任务所需的。此步骤通过仅基于图像的 LoRA 和主体嵌入适应来编码全局主体身份。(2)一个推理时的细外观注入阶段通过计算无 RoPE 的中间层查询-键特征的语义对应关系来细化视觉保真度。这些对应关系指导外观丰富的值表示的变形,使其在生成过程中对齐到语义对应的区域,掩码确保空间可靠性。V-Warper 显著提升了外观保真度,同时保持了提示对齐和运动动态,并且这些增益的实现无需大规模视频微调,效率很高。
引用
@article{arxiv.2512.12375,
title = {V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping},
author = {Hyunkoo Lee and Wooseok Jang and Jini Yang and Taehwan Kim and Sangoh Kim and Sangwon Jung and Seungryong Kim},
journal= {arXiv preprint arXiv:2512.12375},
year = {2025}
}
备注
Project Page: https://cvlab-kaist.github.io/V-Warper