中文

FIT:面向贴身感知的大规模虚拟试穿数据集

计算机视觉与模式识别 2026-04-10 v1 图形学

摘要

给定人员和服装图像,虚拟试穿(VTO)旨在合成佩戴服装后保持原有姿势和身份特征的逼真图像。虽然近期 VTO 方法在可视化服装外观方面表现优异,但它们很大程度上忽略了试穿体验的一个关键方面:服装贴身程度的准确性——例如,显示一件大号上衣戴在小号人身上的样子。一个关键障碍是缺乏提供精确服装和身体尺寸信息的数据集,尤其是针对“不合身”案例,即服装明显太大或太小的情况。因此,当前 VTO 方法默认生成符合人体标准的效果,无论服装或人尺寸如何。本文我们首次尝试解决此问题。我们引入 FIT(Fit-Inclusive Try-on),一个包含超过 113 万试穿图像三元组并伴随精确身体与服装尺寸的大规模 VTO 数据集。我们通过可扩展的合成策略克服数据收集的挑战:(1) 我们程序化生成 3D 服装并通过物理仿真进行包裹,以捕获逼真的服装贴身感。(2) 我们采用新颖的重纹理框架将合成渲染转换为照片逼真的图像,同时严格保持几何特征。(3) 我们将人员身份保留引入重纹理模型,以生成配对人员图像(同一人员,不同服装)用于监督训练。最终,我们利用 FIT 数据集训练了一个基准贴身感知虚拟试穿模型。我们的数据和结果为贴身感知虚拟试穿树立了新的状态最优基准,并为未来研究提供了稳健的评估基准。我们将在项目页面公开所有数据和代码:https://johannakarras.github.io/FIT。

关键词

引用

@article{arxiv.2604.08526,
  title  = {FIT: A Large-Scale Dataset for Fit-Aware Virtual Try-On},
  author = {Johanna Karras and Yuanhao Wang and Yingwei Li and Ira Kemelmacher-Shlizerman},
  journal= {arXiv preprint arXiv:2604.08526},
  year   = {2026}
}

备注

SIGGRAPH 2026