结合时序推理的时序上下文微调用于视频扩散模型的多功能控制
计算机视觉与模式识别
2025-12-15 v2
摘要
文本到视频扩散模型的最新进展已实现高质量视频合成,但可控生成仍具挑战性,尤其是在数据和计算资源有限的情况下。用于条件生成的现有微调方法通常依赖外部编码器或架构修改,这需要大量数据集,且通常局限于空间对齐的条件输入,从而限制了灵活性和可扩展性。在本工作中,我们提出了时序上下文微调(TIC-FT),这是一种高效且通用的方法,用于将预训练视频扩散模型适配到多样的条件生成任务。我们的核心思想是沿时间轴拼接条件帧和目标帧,并插入具有逐步增加噪声水平的中间缓冲帧。这些缓冲帧实现了平滑过渡,使微调过程与预训练模型的时序动态相匹配。TIC-FT 无需架构更改,仅需 10-30 个训练样本即可获得出色性能。我们使用大规模基础模型(如 CogVideoX-5B 和 Wan-14B)在图像到视频和视频到视频生成等一系列任务中验证了该方法。大量实验表明,TIC-FT 在条件保真度和视觉质量上均优于现有基线,同时在训练和推理中保持高效。更多结果请访问 https://kinam0252.github.io/TIC-FT/
引用
@article{arxiv.2506.00996,
title = {Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models},
author = {Kinam Kim and Junha Hyung and Jaegul Choo},
journal= {arXiv preprint arXiv:2506.00996},
year = {2025}
}
备注
project page: https://kinam0252.github.io/TIC-FT/