中文

ID-Crafter: 面向组合多主体视频生成的 VLM 驱动在线强化学习

计算机视觉与模式识别 2026-03-16 v4

摘要

尽管在高保真视频合成方面取得了显著进展,但当前方法往往不足以有效地整合来自多个主体的身份信息,导致语义冲突和在保持身份和相互作用方面性能不佳,限制了可控性和适用性。为解决此问题,我们提出了 ID-Crafter,一个实现卓越身份保持和语义一致性的多主体视频生成框架。ID-Crafter 集成了三个关键组件:(i) 一种在主体内部、主体之间以及跨模态级别逐层聚合特征的层次化身份保持注意力机制;(ii) 由预训练视觉语言模型 (VLM) 提供动力的语义理解模块,以细粒度引导捕捉复杂的主体间关系;(iii) 针对关键概念的在线强化学习阶段进一步细化模型。此外,我们构建了一个新型数据集以促进稳健的训练和评估。广泛的实验表明,ID-Crafter 在多主体视频生成基准测试中实现了新的最先进性能,在身份保持、时序一致性和整体视频质量方面均表现卓越。项目页面: https://angericky.github.io/ID-Crafter

关键词

引用

@article{arxiv.2511.00511,
  title  = {ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation},
  author = {Panwang Pan and Jingjing Zhao and Yuchen Lin and Chenguo Lin and Chenxin Li and Hengyu Liu and Tingting Shen and Yadong MU},
  journal= {arXiv preprint arXiv:2511.00511},
  year   = {2026}
}

备注

Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter