Fashion-RAG:基于检索增强生成的多模态时尚图像编辑
计算机视觉与模式识别
2025-04-22 v1 人工智能
多媒体
摘要
近年来,随着电子商务平台和虚拟应用的普及,时尚行业越来越多地采用人工智能技术来提升客户体验。在各种任务中,虚拟试穿和多模态时尚图像编辑——该方法利用文本、服装草图和身体姿态等多种输入模态——已成为研究的关键领域。扩散模型已成为此类生成任务的领先方法,能够提供卓越的图像质量和多样性。然而,大多数现有虚拟试穿方法依赖于特定的服装输入,而在实际场景中,用户往往只能提供文本规范。为解决这一限制,本文引入时尚检索增强生成(Fashion-RAG),一种新颖的方法,使其能够基于用户提供的文本偏好定制时尚物品。我们的 approach 通过检索多个匹配输入规范的服装,并综合来自检索物品的属性来生成个性化图像。为实现此目标,我们采用文本反转技术,将检索到的服装图像投影到稳定扩散文本编码器的文本嵌入空间,从而实现检索元素在生成过程中的无缝集成。在Dress Code数据集上的实验结果表明,Fashion-RAG在定性和定量上均优于现有方法,有效捕获来自检索服装的细粒度视觉细节。据我们了解,这是首个为多模态时尚图像编辑引入检索增强生成方法。
引用
@article{arxiv.2504.14011,
title = {Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation},
author = {Fulvio Sanguigni and Davide Morelli and Marcella Cornia and Rita Cucchiara},
journal= {arXiv preprint arXiv:2504.14011},
year = {2025}
}
备注
IJCNN 2025