中文

Ingredients:将自定义照片与视频扩散变换器融合

计算机视觉与模式识别 2025-03-19 v2

摘要

本文提出一种强大的框架,用于将多个特定身份(ID)照片融合到视频创作中,结合视频扩散变换器,称为 Ingredients。一般而言,我们的方法由三个主要模块组成:(i)面向每个人 ID 的面部提取器,从全局和局部两个角度捕获多样且精确的面部特征;(ii)多尺度投影器,将面部嵌入映射到视频扩散变换器中图像查询的语境空间;(iii)ID 路由器,动态组合并分配多个 ID 嵌入到相应的时空区域。依托精心策划的文本-视频数据集和多阶段训练协议,Ingredients 在将自定义照片转化为动态个性化视频内容方面表现卓越。定性评估突出了所提方法的优势,使其成为 Transformer 架构下更有效的生成视频控制工具的一个重要进展。数据、代码和模型权重均已公开 disponible at: https://github.com/feizc/Ingredients。

关键词

引用

@article{arxiv.2501.01790,
  title  = {Ingredients: Blending Custom Photos with Video Diffusion Transformers},
  author = {Zhengcong Fei and Debang Li and Di Qiu and Changqian Yu and Mingyuan Fan},
  journal= {arXiv preprint arXiv:2501.01790},
  year   = {2025}
}