基于姿态引导的无调参多角色文本到视频生成
计算机视觉与模式识别
2024-12-30 v2 多媒体
摘要
文本可编辑且具有姿态可控的字符视频生成是具备实际应用价值的挑战性议题。然而,现有方法主要聚焦于单对象视频生成并利用姿态引导,忽视了多角色同时出现于场景中的现实情况。为此,我们提出一种基于分离文本与姿态引导的无调参多角色视频生成框架。具体而言,我们首先从姿态序列中提取角色蒙版,以识别每个生成角色的空间位置,然后通过大语言模型(LLM)为每个角色获取精确的文本指导。此外,我们提出空间对齐的跨注意力和多分支控制模块,用于生成细粒度可控的多角色视频。生成视频的可视化结果表明,我们的方法在多角色生成方面实现了精确的可控性。我们还通过将其应用于 various personalized T2I models 来验证了方法的通用性。此外,定量结果显示,我们的方法在性能上优于现有方法。
引用
@article{arxiv.2412.16495,
title = {Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance},
author = {Beiyuan Zhang and Yue Ma and Chunlei Fu and Xinyang Song and Zhenan Sun and Ziqiang Li},
journal= {arXiv preprint arXiv:2412.16495},
year = {2024}
}
备注
5 pages,conference