中文

探索解耦与可控的人体图像合成:从端到端到分阶段

计算机视觉与模式识别 2026-03-23 v4

摘要

在人体图像合成中实现细粒度可控性是计算机视觉领域的一项长期挑战。现有方法主要侧重于人脸合成或近正面人体生成,难以以解耦方式同时控制视点、姿态、服装和身份等关键因素。本文引入了一项新的解耦与可控人体合成任务,在统一框架内显式分离并操控这四个因素。我们首先在 MVHumanNet 上开发了一个用于因素解耦的端到端生成模型。然而,MVHumanNet 与野外数据之间的域差距导致结果不尽如人意,促使我们探索将虚拟试穿(VTON)数据集作为潜在解决方案。通过实验,我们观察到,简单地将 VTON 数据集作为额外数据来训练端到端模型会降低性能,这主要是由于两个数据集之间的数据形式不一致破坏了解耦过程。为了更好地利用这两个数据集,我们提出了一种分阶段框架,将人体图像生成分解为三个连续步骤:穿衣 A 姿态生成、后视图合成以及姿态和视点控制。这种结构化的流水线能够在不同阶段更好地利用数据集,显著提高了可控性和泛化能力,尤其是在野外场景中。大量实验表明,与端到端模型相比,我们的分阶段方法在视觉保真度和解耦质量上均表现更优,为实际任务提供了一种可扩展的解决方案。更多演示可在项目页面获取:https://taited.github.io/discohuman-project/。

关键词

引用

@article{arxiv.2503.19486,
  title  = {Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage},
  author = {Zhengwentai Sun and Chenghong Li and Hongjie Liao and Xihe Yang and Keru Zheng and Heyuan Li and Yihao Zhi and Shuliang Ning and Shuguang Cui and Xiaoguang Han},
  journal= {arXiv preprint arXiv:2503.19486},
  year   = {2026}
}

备注

A new version with additional experiments