LongCat-Video-Avatar 1.5 技术报告
计算机视觉与模式识别
2026-05-27 v1
摘要
尽管音频驱动视频生成取得了进展,但实现商业级稳定性仍具挑战。我们提出 LongCat-Video-Avatar 1.5,这一升级版开源框架,优先考虑系统工程和生产就绪性而非架构新颖性。通过将音频编码器升级为 Whisper Large 并仔细扩展训练配方,v1.5 实现了精准的唇部同步、完整的身体时序稳定性以及稳健的长视频生成,同时保持严格的身份一致性。通过严格的数据 curated 训练和 RLHF,模型轻松地推广到动漫和动物等 stylized 领域,原生处理复杂的真实世界情形,如多人交互和物体操作。此外,针对工业部署的实际需求,我们采用先进的 step distillation 以加速推理至最佳 8 NFE,在服务效率和视觉保真度之间实现理想的权衡。我们的方法通过大量定量指标和在 500+ 多样化测试案例上的严格人类评估进行了优越性验证。结果表明,v1.5 在人类幽默感评分和我们基准上的专家级质量评估中实现了与 HeyGen、OmniHuman 1.5、Kling Avatar 2.0 等领先封闭源系统的具竞争力或优越性能。凭借其开源发布,LongCat-Video-Avatar 1.5 缩小了学术研究原型与商业级部署之间的差距。
引用
@article{arxiv.2605.26486,
title = {LongCat-Video-Avatar 1.5 Technical Report},
author = {Meituan LongCat Team and Xunliang Cai and Meng Cheng and Feng Gao and Zhe Kong and Jiamu Li and Le Li and Weiheng Li and Hongyu Liu and Shuai Tan and Xiaoming Wei and Tianyu Yang and Yong Zhang},
journal= {arXiv preprint arXiv:2605.26486},
year = {2026}
}
备注
Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video