中文

一种通用模型:基于 LLM 灵感的双向 Tweedie 扩散实现任意姿态下的统一试穿与试脱

计算机视觉与模式识别 2026-04-15 v3

摘要

最近的扩散方法在图像基虚拟试穿方面取得了显著进展,实现了更真实、端到端的服装合成。然而,大多数现有方法仍受限于依赖展览服装和分割掩码,以及处理灵活姿态变体的能力有限,这些局限性降低了在实际场景中的实用性;例如,用户无法轻松将一人穿着的服装转移到另一人身上,生成的试穿结果通常仅限于参考图像的同一姿态。本文引入 OMFA(One Model For All),一个用于虚拟试穿和试脱的统一扩散框架,无需展览服装,支持任意姿态。OMFA 受离散扩散语言模型的掩码范式启发,构建在基于双向 Tweedie 扩散的框架中,用于目标选择性去噪于潜在空间。它无需下身约束,仅需单张肖像和目标服装作为输入,旨在支持灵活的服装组合和跨人服装转移,更贴合实际使用场景。此外,借助基于 SMPL-X 的姿态条件,OMFA 支持仅通过单张图像实现多视角和任意姿态试穿。广泛实验表明,OMFA 在试穿和试脱任务上实现了最先进的结果,为虚拟服装合成提供了实用且通用的解决方案。项目页面:https://onemodelforall.github.io

关键词

引用

@article{arxiv.2508.04559,
  title  = {One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion},
  author = {Jinxi Liu and Zijian He and Guangrun Wang and Guanbin Li and Liang Lin},
  journal= {arXiv preprint arXiv:2508.04559},
  year   = {2026}
}