LongCat-Video 技术报告
计算机视觉与模式识别
2025-10-29 v2
摘要
视频生成是通向世界模型的关键路径,高效的长视频推理是关键能力。为此,我们引入 LongCat-Video,一个拥有 136 亿参数的基础视频生成模型,在多个视频生成任务上均表现出色。它在高质量的长视频生成方面尤为出色,代表我们对世界模型的第一步。关键特征包括:统一的多任务架构:基于扩散转换器(DiT)框架构建的 LongCat-Video 支持文本到视频、图像到视频和视频续写任务,单模型即可实现;长视频生成:在视频续写任务上预训练,使 LongCat-Video 能够在生成分钟级视频时保持高质量和时序连贯性;高效推理:LongCat-Video 通过在时空轴上采用粗到细生成策略,能够在数分钟内生成 720p、30fps 的视频。块稀疏注意力进一步提升了效率,尤其在高分辨率时效果显著;多奖励 RLHF 训练带来强大性能:多奖励 RLHF 训练使 LongCat-Video 达到与最新闭源模型及领先开源模型持平的性能。代码和模型权重已公开,以加快该领域的进展。
引用
@article{arxiv.2510.22200,
title = {LongCat-Video Technical Report},
author = {Meituan LongCat Team and Xunliang Cai and Qilong Huang and Zhuoliang Kang and Hongyu Li and Shijun Liang and Liya Ma and Siyu Ren and Xiaoming Wei and Rixu Xie and Tong Zhang},
journal= {arXiv preprint arXiv:2510.22200},
year = {2025}
}