中文

Phantom:基于跨模态对齐的主体一致视频生成

机器人学 2025-05-29 v3 人工智能 系统与控制 系统与控制

摘要

基础模型For视频生成的持续发展正在催生各种应用,但主体一致视频生成仍处于探索阶段。我们将此称为主体到视频(Subject-to-Video),即从参考图像中提取主体元素,并生成遵循文本指令的主体一致视频。我们认为,主体到视频的本质在于平衡文本和图像双模态提示,从而深入且同时对齐文本和视觉内容。为此,我们提出了Phantom——一个集成单主体和多主体参考的统一视频生成框架。基于现有的文本到视频和图像到视频架构,我们重新设计了联合文本-图像注入模型,并通过文本-图像-视频三元组数据驱动其学习跨模态对齐。该方法实现了高保真度的主体一致视频生成,同时解决了图像内容泄露和多主体混淆问题。评估结果表明,我们的方法在其他最先进的闭源商业解决方案中均表现出色。特别地,我们强调人类生成中的主体一致性,涵盖了现有的ID保留视频生成,同时提供了增强的优势。

关键词

引用

@article{arxiv.2502.11057,
  title  = {A Physics-Informed Machine Learning Framework for Safe and Optimal Control of Autonomous Systems},
  author = {Manan Tayal and Aditya Singh and Shishir Kolathaya and Somil Bansal},
  journal= {arXiv preprint arXiv:2502.11057},
  year   = {2025}
}

备注

22 Pages, 12 Figures. First two authors have contributed equally. Accepted at ICML 2025