FashionM3:基于统一视觉语言模型的多模态、多任务、多轮时尚助手
计算机视觉与模式识别
2025-04-28 v1 人工智能
摘要
时尚搭配和个性化推荐是现代零售业中至关重要的环节,为时尚行业的经济价值贡献了巨大的价值。随着视觉语言模型(Vision-Language Models, VLM)的出现,为通过自然语言和视觉交互来提升零售业的机会不断涌现。本工作提出FashionM3,一个基于VLM微调实现的多模态、多任务、多轮时尚助手。它帮助用户通过提供个人化推荐、替代建议、产品图像生成和虚拟试穿模拟等多项功能,发现令人满意的穿搭方案。基于 novel FashionRec 数据集进行微调,该数据集包含331,124个跨基础、个性化和替代推荐任务的多模态对话样本。FashionM3通过多轮交互实现上下文相关的个性化建议,并实现迭代式的细化。定量和定性评估以及用户研究均表明,FashionM3在推荐效果和作为时尚助手的实际价值方面表现卓越。
引用
@article{arxiv.2504.17826,
title = {FashionM3: Multimodal, Multitask, and Multiround Fashion Assistant based on Unified Vision-Language Model},
author = {Kaicheng Pang and Xingxing Zou and Waikeung Wong},
journal= {arXiv preprint arXiv:2504.17826},
year = {2025}
}