中文

从假脸到人类:基于姿态感知和身份保持的 mannequin 到 human 视频生成框架

计算机视觉与模式识别 2025-10-21 v1 图形学

摘要

假脸人形服装展示为线上时尚展示提供了一种具有成本效益的替代方案,尽管其真实性和表现细节有限。为克服这一限制,我们提出了一种新任务,即 mannequin 到 human (M2H) 视频生成,旨在从假脸人形的影片中合成可控身份、逼真的人类视频。我们提出了 M2HVideo,一种姿态感知、身份保持的视频生成框架,旨在解决两个关键挑战:头部与身体运动的错位,以及由时间建模引起的身份漂移。具体而言,M2HVideo 包含一个动态姿态感知头部编码器,将面部语义与身体姿态融合,以在帧之间产生一致的身份嵌入。为解决由于潜在空间压缩导致的面部细节丢失,我们引入了通过基于 denoising diffusion implicit model (DDIM) 的一步去噪在像素空间应用的镜像损失。此外,我们设计了一个分布感知适配器,以增强身份特征和服装特征的时间一致性。在 UBC 时尚数据集、我们自构建的 ASOS 数据集以及新收集的 MannequinVideos 数据集上进行实验,证明 M2HVideo 在服装一致性、身份保持和视频保真度方面均优于最先进的方法。

关键词

引用

@article{arxiv.2510.16833,
  title  = {From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display},
  author = {Xiangyu Mu and Dongliang Zhou and Jie Hou and Haijun Zhang and Weili Guan},
  journal= {arXiv preprint arXiv:2510.16833},
  year   = {2025}
}