用于文本到视频预测中微调扩散模型的逐帧条件适配
计算机视觉与模式识别
2025-11-25 v2
摘要
文本到视频预测 (TVP) 是一项下游视频生成任务,要求模型在给定一系列初始视频帧和描述所需运动的文本后,生成后续视频帧。在实践中,TVP 方法主要关注描绘由人类或机械臂执行物体操作的特定类别视频。以往的方法采用在文本到图像任务上预训练的模型,因此生成的视频往往缺乏所需的连续性。一个自然的进展是利用更新的预训练文本到视频 (T2V) 模型。然而,最常见的微调技术——低秩适配 (LoRA) 会产生不理想的结果,这使得该方法面临更大挑战。在本工作中,我们提出了一种基于适配的策略,将其称为逐帧条件适配 (FCA)。在该模块内,我们设计了一个子模块,可以从输入文本生成逐帧文本嵌入,作为辅助文本条件来辅助生成。我们使用 FCA 微调 T2V 模型,该模型将初始帧作为额外条件纳入。我们比较并讨论了将此类嵌入注入 T2V 模型的更有效策略。我们通过定量和定性的性能分析,对设计选择进行了广泛的消融研究。我们的方法为 TVP 任务确立了新的 SOTA。我们的代码已在 https://github.com/Cuberick-Orion/FCA 开源。
引用
@article{arxiv.2503.12953,
title = {Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction},
author = {Zheyuan Liu and Junyan Wang and Zicheng Duan and Cristian Rodriguez-Opazo and Anton van den Hengel},
journal= {arXiv preprint arXiv:2503.12953},
year = {2025}
}
备注
Accepted by TMLR, 11/2025. 29 pages, 15 figures