ModelGrow:通过模型扩张和语言理解增强进行文本到视频持续预训练
计算机视觉与模式识别
2024-12-30 v1 人工智能
机器学习
摘要
文本到视频 (T2V) 生成最近受到广泛关注。然而,从头训练 T2V 模型的成本仍然很高,在有限计算资源下提高生成性能仍有很大提升空间。这一工作探索了文本到视频模型的持续通用预训练,使模型能够基于预训练的基础进行“成长”,类似于人类基于过往经验获取新知识的过程。在 T2V 生成领域,持续预训练技术的 extensive 研究仍不足。本文系统地探索了这一任务,提出了 ModelGrow。具体而言,我们将该任务分为两个关键方面:增加模型容量和提高语义理解。对于模型容量,我们引入了若干新技术,以扩大模型规模,使其能够存储新知识并提高生成性能。对于语义理解,我们提出了一种方法,利用大型语言模型作为高级文本编码器,将其集成到 T2V 模型中,以增强语言理解并根据详细提示指导生成结果。该方法使模型能够实现更好的语义对齐,尤其在应对复杂用户提示时效果显著。广泛的实验表明,我们的方法在各种指标上都有效。ModelGrow 的源代码和模型将对外公开。
引用
@article{arxiv.2412.18966,
title = {ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement},
author = {Zhefan Rao and Liya Ji and Yazhou Xing and Runtao Liu and Zhaoyang Liu and Jiaxin Xie and Ziqiao Peng and Yingqing He and Qifeng Chen},
journal= {arXiv preprint arXiv:2412.18966},
year = {2024}
}
备注
18 pages