RAGDiffusion:通过外部知识 assimilating 实现服装生成的忠实性
计算机视觉与模式识别
2025-10-13 v3 人工智能
图形学
机器学习
摘要
标准服装资产生成涉及从多样化真实场景中提取服装信息以恢复正面平面服饰图像,这种高标准生成任务因高度标准化的结构抽样分布和复杂情境下的服装语义缺失而 presents significant挑战。现有模型具有有限的空间感知能力,常在结构幻觉和纹理失真方面表现不佳。为此,我们提出一种新颖的检索增强生成(RAG)框架,称为RAGDiffusion,通过吸收语言模型和外部数据库的知识来增强结构确定性并缓解幻觉现象。RAGDiffusion包含两个过程:(1)基于检索的结构聚合,采用对比学习和结构局部线性嵌入(SLLE)推导全局结构和空间地标,提供软硬指导以抵消结构模糊性;(2)全程忠实服饰生成,引入粗到细纹理对齐,确保扩散过程中图案和细节组件的忠实度。广泛的实验表明,RAGDiffusion在挑战性真实数据集上合成了结构和纹理忠实的服装资产,性能显著提升,标志着以RAG应对内在幻觉、提升忠实度的高标准生成的 pioneering 工作。
引用
@article{arxiv.2411.19528,
title = {RAGDiffusion: Faithful Cloth Generation via External Knowledge Assimilation},
author = {Xianfeng Tan and Yuhan Li and Wenxiang Shang and Yubo Wu and Jian Wang and Xuanhong Chen and Yi Zhang and Ran Lin and Bingbing Ni},
journal= {arXiv preprint arXiv:2411.19528},
year = {2025}
}
备注
Accept by ICCV 2025 (Highlight). Project website: https://colorful-liyu.github.io/RAGDiffusion-page/