VTEdit-Bench:用于虚拟试穿多参考图像编辑模型的全面基准
计算机视觉与模式识别
2026-03-13 v1
摘要
随着虚拟试穿(VTON)的不断进步,越来越多的真实场景涌现,超越了现有专门 VTON 模型的能力。与此同时,通用多参考图像编辑模型取得了快速进展,在视觉编辑方面表现出强大的泛化能力,指向更灵活的 VTON 系统。然而,尽管这些通用编辑器具有强大的能力,但由于缺乏系统性评估基准,仍不充分地探索了通用编辑器在 VTON 方面的优势与局限。为填补这一空白,我们引入 VTEdit-Bench,一个全面的基准,旨在评估通用多参考图像编辑模型在各种真实 VTON 场景中的表现。VTEdit-Bench 包含 24,220 对测试图像对,涵盖五个具有递增复杂度的代表性 VTON 任务, enables 对鲁棒性和泛化性进行系统性分析。我们进一步提出了 VTEdit-QA,一个参考感知的 VLM 基于评估器, 从模型一致性、衣物一致性和整体图像质量三个关键方面评估 VTON 性能。通过这个框架,我们系统评估了八个通用编辑模型,并将其与七个专门的 VTON 模型进行比较。结果表明,顶级通用编辑器在传统任务上与竞争力相当,并在更复杂的情景中实现更稳定的泛化,但在复杂的参考配置(特别是多衣物条件)方面仍面临挑战。
引用
@article{arxiv.2603.11734,
title = {VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On},
author = {Xiaoye Liang and Zhiyuan Qu and Mingye Zou and Jiaxin Liu and Lai Jiang and Mai Xu and Yiheng Zhu},
journal= {arXiv preprint arXiv:2603.11734},
year = {2026}
}