中文

VersaVogue: 用于统一服装合成的视觉专家编排与偏好对齐

计算机视觉与模式识别 2026-04-09 v1

摘要

扩散模型推动了服装图像生成的显著进步,但先前工作通常将服装生成和虚拟试穿视为独立问题,限制了其在真实服装工作流程中的灵活性。此外,在多源异构条件下的服装图像合成仍然具有挑战性,因为现有方法通常依赖简单的特征拼接或静态逐层注入,这往往导致属性纠缠和语义干扰。为解决这些问题,我们提出了VersaVogue,一个用于多条件可控服装合成的统一框架,同时支持服装生成和虚拟试穿,对应服装生命周期的设计和展示阶段。具体而言,我们引入了一种特征路由注意力(TA)模块,利用专家混合机制将条件特征动态路由到最兼容的专家和生成层,实现纹理、形状和颜色等视觉属性的解耦注入。为进一步提高真实感和可控性,我们开发了一种自动化多视角偏好优化(MPO)流水线,无需人工标注或任务特定奖励模型即可构建偏好数据。通过结合内容保真度、文本对齐和感知质量的评估器,MPO识别可靠的偏好对,然后用于通过直接偏好优化(DPO)优化模型。在服装生成和虚拟试穿基准上的大量实验表明,VersaVogue在视觉保真度、语义一致性和细粒度可控性方面持续优于现有方法。

关键词

引用

@article{arxiv.2604.07210,
  title  = {VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis},
  author = {Jian Yu and Fei Shen and Cong Wang and Yi Xin and Si Shen and Xiaoyu Du and Jinhui Tang},
  journal= {arXiv preprint arXiv:2604.07210},
  year   = {2026}
}