中文

SIFT-VTON:基于跨注意力的几何对应关系监督的虚拟试穿

计算机视觉与模式识别 2026-05-05 v1

摘要

基于扩散的虚拟试穿方法通过跨注意力机制实现了对 garment 特征向目标身体区域的迁移,从而实现了超高保真的合成效果。然而,这些方法依赖于对空间对应关系的隐式学习,难以保留细节如文本和插图。我们提出了一种新方法,称为 SIFT-VTON,使用 SIFT 关键点匹配为扩散-based 虚拟试穿提供显式的几何指导。该方法对 garment 图像和 person 图像之间的 SIFT 关键点匹配应用了领域特定的过滤,然后将这些对应关系转换为用于训练期间监督跨注意力层的空间概率分布。这种显式监督指导模型学习精确的空间对齐,集中注意力于几何一致的 garment 区域。在 VITON-HD 数据集上的实验表明,在保持竞争性的配对重建指标的同时,实现了在无配对指标上的显著改进。定性比较显示,文本清晰度和图案对齐方面表现出优势。注意力可视化确认,我们的方法在相关 garment 细节上产生了清晰聚焦的注意力。本工作表明,经典的几何对应方法可以有效增强面向条件合成任务的现代扩散模型。源代码将在 https://github.com/takesukeDS/SIFT-VTON 上提供。

关键词

引用

@article{arxiv.2605.01296,
  title  = {SIFT-VTON: Geometric Correspondence Supervision on Cross-Attention for Virtual Try-On},
  author = {Kosuke Takemoto and Takafumi Koshinaka},
  journal= {arXiv preprint arXiv:2605.01296},
  year   = {2026}
}

备注

Accepted at ICPR2026