中文

ProFashion:基于原型引导的多参考图像时装视频生成

计算机视觉与模式识别 2026-04-01 v2 人工智能

摘要

时装视频生成旨在从指定角色的参考图像合成具有时序一致性的视频。尽管取得了显著进展,现有扩散方法仅支持单个参考图像作为输入,严重限制了其生成视角一致性的能力,尤其是在来自不同视角的服装图案不同时。此外,广泛采用的运动模块未能充分建模人体运动,导致时空一致性次优。为此,我们提出 ProFashion,一个利用多个参考图像实现改进视角一致性和时序一致性的时装视频生成框架。为有效利用多个参考图像的特征同时保持合理的计算成本,我们设计了 Pose-aware Prototype Aggregator,该模块根据姿态信息选择和聚合全局和细粒度参考特征,以形成帧级原型,这些原型作为去噪过程中的指导。为进一步增强运动一致性,我们引入 Flow-enhanced Prototype Instantiator,利用人体关键点运动流引导去噪器中的额外时空注意力过程。为证明 ProFashion 的有效性,我们在从互联网收集的 MRFashion-7K 数据集上进行了广泛评估。ProFashion 也在 UBC Fashion 数据集上超过以前的方法。

关键词

引用

@article{arxiv.2505.06537,
  title  = {ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images},
  author = {Xianghao Kong and Qiaosong Qi and Yuanbin Wang and Biaolong Chen and Aixi Zhang and Anyi Rao},
  journal= {arXiv preprint arXiv:2505.06537},
  year   = {2026}
}

备注

CVPRW 2026