OmniTry:无掩码的虚拟试穿任何物品
计算机视觉与模式识别
2025-08-20 v1
摘要
虚拟试穿 (VTON) 是一个实用且广泛应用的任务,现有大多数方法聚焦于服装。本文提出 OmniTry,一个统一框架,将 VTON 扩展 Beyond garment 到任何可穿戴物品,例如珠宝和配件,采用无掩码设置以实现更实用的应用。当扩展到各种类型物品时,数据 curation 具有挑战性,难以获得成对的图像,即物品图像和相应的 try-on 结果. 为解决此问题,我们提出 two-staged pipeline:对于 first stage,我们利用 large-scale unpaired images,即包含任何可穿戴物品的肖像图像,训练模型实现无掩码 localisation。具体而言,我们重新利用填充模型自动在合适位置绘制物品,给定 empty mask。对于 second stage,模型进一步 fine-tune 配对图像以传递物品外观的一致性。我们观察到,first stage 后的模型即使仅用少量配对样本也能快速收敛。OmniTry 在由 12 种常见可穿戴物品类别组成的全面基准测试中进行评估,包含 in-shop 和 in-the-wild 图像。实验结果表明,OmniTry 在 object localisation 和 ID-preservation 方面优于现有方法。OmniTry 的代码、模型权重和评估基准将在 https://omnitry.github.io/ 对公众开放。
引用
@article{arxiv.2508.13632,
title = {OmniTry: Virtual Try-On Anything without Masks},
author = {Yutong Feng and Linlin Zhang and Hengyuan Cao and Yiming Chen and Xiaoduan Feng and Jian Cao and Yuxiong Wu and Bin Wang},
journal= {arXiv preprint arXiv:2508.13632},
year = {2025}
}