从像素到帖子:检索增强的时尚描述和标签生成
计算机视觉与模式识别
2025-11-25 v1 人工智能
计算与语言
摘要
本文介绍一种检索增强框架,用于自动时尚描述和标签生成,结合了多 garment 检测、属性推理和大型语言模型(LLM)提示。该系统旨在为时尚图像生成具有视觉依托、描述性和风格化特征的文本,克服了 end-to-end 描述器在属性忠实度和领域泛化方面的局限性。该管道组合了基于 YOLO 的多 garment 检测器用于局部化、K 均值聚类用于提取主导颜色,以及 CLIP-FAISS 检索模块用于基于结构化产品索引的面料和性别属性推断。这些属性以及检索到的风格示例一起创建一个由事实证据构成的包,用于指导 LMM 生成类似人类的描述和富有情境性的标签。用于监督基线比较的使用微调的 BLIP 模型。实验结果表明,YOLO 检测器能够为九类 garment 获得平均精度([email protected])为 0.71。RAG-LLM 管道生成表达性、属性对齐的描述,并在标签生成中实现属性覆盖率为 0.80,完全覆盖率在 50% 阈值处,而 BLIP 提供更高的词汇重叠且泛化性更低。检索增强的方法表现出更好的事实依托,幻觉更少,在各种服装领域中具有可扩展的部署潜力。这些结果表明,检索增强生成作为一种有效且可解释的方法,用于自动化和视觉依托的时尚内容生成。
引用
@article{arxiv.2511.19149,
title = {From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation},
author = {Moazzam Umer Gondal and Hamad Ul Qudous and Daniya Siddiqui and Asma Ahmad Farhan},
journal= {arXiv preprint arXiv:2511.19149},
year = {2025}
}
备注
Submitted to Expert Systems with Applications