Motif-Video 2B: 技术报告
计算机视觉与模式识别
2026-05-20 v2 人工智能
摘要
训练强大的视频生成模型通常需要大规模数据集、庞大的参数规模以及巨大的计算资源。本文探讨是否可能在有限预算下实现优异的文本到视频质量:数据集规模不足 1000 万片段,计算资源不足 10 万 GPU 小时。我们的核心论点是,模型容量的组织方式(而非其绝对规模)在一定程度上决定了性能。视频生成中,提示词对齐、时序一致性与细节恢复常通过同一路径实现,彼此之间可能产生干扰。Motif-Video 2B 通过架构设计将这些职责分离,而非依赖规模扩张。该模型融合了两项关键思想:其一,共享交叉注意力(Shared Cross-Attention)在视频 token 序列较长时强化文本控制;其二,三段式 backbone 将早期融合、联合表征学习与细节细化功能划分为独立模块。为此设计在有限计算预算下仍具有效性,我们采用基于动态 token 路由和早期阶段对冻结预训练视频编码器进行特征对齐的高效训练配方。我们的分析表明,后期模块展现出更清晰的跨帧注意力结构,优于标准单流基线。在 VBench 上,Motif-Video 2B 达到 83.76% 的综合得分,超越 Wan2.1 14B 模型,同时使用约 7 倍更少的参数和更小的数据集进行训练。这些结果表明,谨慎的架构专化与高效训练配方,足以缩小甚至超过通常与大规模视频模型相关的性能鸿沟。
引用
@article{arxiv.2604.16503,
title = {Motif-Video 2B: Technical Report},
author = {Junghwan Lim and Wai Ting Cheung and Minsu Ha and Beomgyu Kim and Taewhan Kim and Haesol Lee and Dongpin Oh and Jeesoo Lee and Taehyun Kim and Minjae Kim and Sungmin Lee and Hyeyeon Cho and Dahye Choi and Jaeheui Her and Jaeyeon Huh and Hanbin Jung and Changjin Kang and Dongseok Kim and Jangwoong Kim and Youngrok Kim and Hyukjin Kweon and Hongjoo Lee and Jeongdoo Lee and Junhyeok Lee and Eunhwan Park and Yeongjae Park and Bokki Ryu and Dongjoo Weon},
journal= {arXiv preprint arXiv:2604.16503},
year = {2026}
}