视频扩散变换器是上下文学习器
计算机视觉与模式识别
2025-03-25 v3
摘要
本文探讨了如何通过最小化激活调整,使视频扩散变换器具备上下文能力。具体而言,我们提出了一条简单流程来利用上下文生成:()在空间或时间维度上拼接视频,()从单个数据源获取的多场景视频剪辑进行联合标注,()使用精心挑选的小型数据集进行任务特定的微调。通过一系列多样化的可控任务,我们定性地展示了现有的高级文本到视频模型能够有效地执行上下文生成。值得注意的是,这一方法允许创建持续超过30秒的一致多场景视频,而无需额外的计算开销。重要的是,该方法无需修改原始模型,生成的高保真视频输出更符合提示规范,同时保持角色一致性。我们的框架为研究社区提供了宝贵的工具,为推进面向产品的可控视频生成系统提供了关键见解。数据、代码和模型权重均可在 https://github.com/feizc/Video-In-Context 公开获取。
引用
@article{arxiv.2412.10783,
title = {Video Diffusion Transformers are In-Context Learners},
author = {Zhengcong Fei and Di Qiu and Debang Li and Changqian Yu and Mingyuan Fan},
journal= {arXiv preprint arXiv:2412.10783},
year = {2025}
}