OmniFashion: 通过多任务视觉语言学习实现通用时尚智能
计算机视觉与模式识别
2026-03-04 v1
摘要
时尚智能涉及多个任务,即检索、推荐、识别和对话,但因监督碎片化和时尚注释不完整而受限。这些限制共同阻碍了一致的视觉-语义结构形成,防止近期视觉语言模型 (VLM) 作为通用时尚大脑发挥作用,以统一理解和推理跨任务。因此,我们构建 FashionX,一个规模为百万级的数据集,对其中可见时尚物品进行详尽注释,并从全局到局部组织属性。基于此基础,我们提出 OmniFashion,一个统一的视觉语言框架,将 diverse 时尚任务在统一的时尚对话范式下连接,实现多任务推理和交互式对话。在多子任务和检索基准测试中的实验表明,OmniFashion 在任务层面的准确性和跨任务泛化方面均取得优异成绩,凸显其为通用、以对话为导向的时尚智能提供可扩展路径。
引用
@article{arxiv.2603.02658,
title = {OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning},
author = {Zhengwei Yang and Andi Long and Hao Li and Zechao Hu and Kui Jiang and Zheng Wang},
journal= {arXiv preprint arXiv:2603.02658},
year = {2026}
}
备注
12 pages, 8 figures