FashionLens:基于任务自适应学习的通用时尚图像检索
计算机视觉与模式识别
2026-05-22 v1 多媒体
摘要
时尚图像检索是现代电商系统的基石。一个支持多样查询格式和检索意图的统一框架在实际中高度受需求。然而,现有方法聚焦于狭窄的检索任务,未充分捕捉这种多样性。因此,本文旨在开发一种统一框架,能够处理多样现实场景下的时尚检索,实现真正通用的时尚图像检索。为建立数据基础,首先我们引入 U-FIRE,一个综合性基准,将零散的时尚数据集整合为统一集合,并配以两个人工精选的数据集用于测试泛化能力。基于此,我们提出 FashionLens,一个基于多模态大语言模型的统一框架。为处理不同的匹配目标,我们设计了 Proposal-Guided Spherical Query Calibrator,通过自适应球面线性插值动态将查询表示移向任务对齐的度量空间。此外,为缓解因任务复杂度和数据规模差异导致的优化不平衡,我们开发了 Gradient-Guided Adaptive Sampling 策略,自动根据实时学习难度和数据规模先验对任务进行重新加权。在 U-FIRE 上进行的实验表明,FashionLens 在多样检索场景下实现了最先进的性能,并对未见任务具有稳健的泛化能力。数据和代码已公开发布于 https://github.com/haokunwen/FashionLens。
引用
@article{arxiv.2605.22552,
title = {FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning},
author = {Haokun Wen and Xuemeng Song and Xinghao Xie and Xiaolin Chen and Xiangyu Zhao and Weili Guan},
journal= {arXiv preprint arXiv:2605.22552},
year = {2026}
}