ALIVE:用逼真的音视频生成让你的世界动起来
计算机视觉与模式识别
2026-02-11 v2
摘要
视频生成正迅速朝着统一的音视频生成方向发展。在本文中,我们提出了 ALIVE,一个将预训练的文本到视频(T2V)模型适配到 Sora 风格音视频生成和动画的生成模型。具体来说,与 T2V 基础模型相比,该模型解锁了文本到视频和音频(T2VA)以及参考到视频和音频(动画)的能力。为了支持音视频同步和参考动画,我们用一个联合的音视频分支增强了流行的 MMDiT 架构,该分支包括用于时间对齐的跨模态融合的 TA-CrossAttn 和用于精确音视频对齐的 UniTemp-RoPE。同时,精心设计了一个包含音视频字幕生成、质量控制等的全面数据流水线,以收集高质量的微调数据。此外,我们引入了一个新的基准测试来执行全面的模型测试和比较。在百万级高质量数据上进行持续预训练和微调后,ALIVE 展现了出色的性能,持续优于开源模型,并达到或超越了最先进的商业解决方案。通过详细的配方和基准测试,我们希望 ALIVE 能帮助社区更高效地开发音视频生成模型。官方页面:https://github.com/FoundationVision/Alive。
引用
@article{arxiv.2602.08682,
title = {ALIVE: Animate Your World with Lifelike Audio-Video Generation},
author = {Ying Guo and Qijun Gan and Yifu Zhang and Jinlai Liu and Yifei Hu and Pan Xie and Dongjun Qian and Yu Zhang and Ruiqi Li and Yuqi Zhang and Ruibiao Lu and Xiaofeng Mei and Bo Han and Xiang Yin and Bingyue Peng and Zehuan Yuan},
journal= {arXiv preprint arXiv:2602.08682},
year = {2026}
}
备注
Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/