中文

FashionDPO:基于直接偏好优化微调时尚服装生成模型

多媒体 2025-04-18 v1 信息检索

摘要

个性化服装搭配旨在构建一组兼容且符合用户偏好的时尚物品组合。最近,生成式 AI 模型广受关注,因为它们可以为用户完成不完整的服装搭配或创建完整的服装组合。然而,这些模型在多样性和依赖监督学习范式方面存在局限。为弥合这一差距,我们提出了一种新框架 FashionDPO,该框架使用直接偏好优化(DPO)来微调时尚服装生成模型。该框架旨在为时尚生成模型提供一种通用的微调方法,利用自动生成的反馈进行模型微调,而无需设计特定于任务的奖励函数。为确保反馈的全面性和客观性,我们设计了一个多专家反馈生成模块,覆盖质量、搭配和个性化三个评估视角。在两个既定数据集(即 iFashion 和 Polyvore-U)上的实验表明,我们框架在提升模型符合用户个性化偏好方面的能力方面有效,同时遵循时尚搭配原则。我们的代码和模型检查点已在 https://github.com/Yzcreator/FashionDPO 上提供。

关键词

引用

@article{arxiv.2504.12900,
  title  = {FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization},
  author = {Mingzhe Yu and Yunshan Ma and Lei Wu and Changshuo Wang and Xue Li and Lei Meng},
  journal= {arXiv preprint arXiv:2504.12900},
  year   = {2025}
}

备注

Accepted by SIGIR'25