中文

Fashion Florence:微调 Florence-2 用于结构化时尚属性提取

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

我们提出了 Fashion Florence,一个使用 LoRA 微调的 Florence-2 视觉语言模型,用于从服装图像中提取结构化时尚属性。给定单张照片,该模型生成一个包含类别、颜色、材质、风格标签和场合标签的 JSON 对象,这种结构化输出适合下游推荐和检索系统直接进行程序化消费。微调数据源自 iMaterialist Fashion 数据集(228 个标签),我们通过基于规则的标签工程将细粒度标注压缩为紧凑的 6 类别、16 颜色、19 风格模式。我们将 LoRA (r=16, alpha=32) 应用于所有解码器线性层,在 3,688 个样本上训练 3 个 epoch。在 461 张图像的留出测试集上,Fashion Florence 实现了 94.6% 的类别准确率和 63.0% 的材质准确率,而 GPT-4o-mini 为 89.3% / 43.3%,Gemini 2.5 Flash 为 87.4%。Fashion Florence 在 99.8% 的输出中生成有效的 JSON,同时在单个 GPU 上以 0.77B 参数运行,边际推理成本为零。风格标签 F1 达到 0.753,而 Gemini 为 0.612,GPT-4o-mini 为 0.398。该模型被部署为 Hugging Face Space,并集成到 Loom(一个开源穿搭推荐系统)中。

关键词

引用

@article{arxiv.2605.09827,
  title  = {Fashion Florence: Fine-Tuning Florence-2 for Structured Fashion Attribute Extraction},
  author = {Anushree Berlia},
  journal= {arXiv preprint arXiv:2605.09827},
  year   = {2026}
}

备注

Model: https://huggingface.co/anushreeberlia/fashion-florence