CINEMA:基于 MLLM 的多主体视频生成
计算机视觉与模式识别
2025-03-14 v1 人工智能
摘要
随着深度生成模型,特别是扩散模型的出现,视频生成取得了显著进展。虽然现有方法在从文本提示或单张图像生成高质量视频方面表现突出,但针对个性化多主体视频生成仍是 largely 未探索的挑战。该任务涉及合成包含由多个独立参考图像定义的不同主体的视频,同时确保时间和空间一致性。当前方法主要依赖将主体图像映射到文本提示中的关键词,导致模糊性,并限制其有效建模主体关系的能力。本文提出 CINEMA,一种通过多模态大语言模型 (MLLM) 实现协同多主体视频生成的新框架。我们的做法消除了主体图像与文本实体之间的显式对应关系,从而减轻了模糊性并减少了标注工作。通过利用 MLLM 解释主体关系,我们的方法实现了可扩展性,使大规模且多样化的数据集可用于训练。此外,我们的框架可基于可变数量的主体进行条件化,为个性化内容创建提供了更大的灵活性。通过广泛的评估,我们展示了该方法在主体一致性和整体视频连贯性方面显著优于现有方法,为故事叙述、交互媒体和个性化视频生成等高级应用铺平了道路。
引用
@article{arxiv.2503.10391,
title = {CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance},
author = {Yufan Deng and Xun Guo and Yizhi Wang and Jacob Zhiyuan Fang and Angtian Wang and Shenghai Yuan and Yiding Yang and Bo Liu and Haibin Huang and Chongyang Ma},
journal= {arXiv preprint arXiv:2503.10391},
year = {2025}
}