基于掩码语言提示的few-shot 时尚风格识别生成数据增强
计算机视觉与模式识别
2026-05-08 v2
摘要
构建时尚风格识别数据集面临风格概念固有的主观性和模糊性挑战。近期文本到图像模型的进展促进了从标记数据合成图像的生成数据增强,但仅基于类名或参考描述的现有方法往往难以在视觉多样性和风格一致性之间取得平衡。本文提出一种掩码语言提示(Masked Language Prompting, MLP),这是一种新颖的提示策略,通过掩码选定词汇于参考描述中,并利用大型语言模型生成多样且语义连贯的补全。该方法保留原始描述的结构语义,同时引入与预期风格一致的属性级变体,实现无需微调即可进行风格一致且多样的图像生成。在 FashionStyle14 数据集上的实验结果表明,基于 MLP 的数据增强在类别名称和描述基线方法之上持续表现更佳,验证了其在受限监督条件下为时尚风格识别的有效性。
引用
@article{arxiv.2504.19455,
title = {Masked Language Prompting for Generative Data Augmentation in Few-shot Fashion Style Recognition},
author = {Yuki Hirakawa and Ryotaro Shimizu},
journal= {arXiv preprint arXiv:2504.19455},
year = {2026}
}