中文

TATTOO:无训练的美学感知服装搭配

计算机视觉与模式识别 2025-09-30 v1

摘要

全球时尚电商市场广泛依赖智能且美学感知的服装搭配工具来推动销售。虽然已有研究尝试解决服装搭配和兼容物品检索问题,但大多数方法需要在大规模标注数据上进行昂贵且任务特定的训练,且未力求以显式的人类美学指导服装搭配。在多模态大语言模型(MLLM)时代,我们展示了常规基于训练的管道可被简化为无训练范式,同时在推荐得分和美学感知方面表现更佳。我们通过 TATTOO(Training-free AesTheTic-aware Outfit recommendation)实现了这一目标。该方法首先使用 MLLM 生成目标物品描述,随后采用美学链式思维将图像提炼为包含颜色、风格、场合、季节、材料和平衡感的结构化美学概要。通过基于动态熵门控机制将服装的视觉概述与文本描述和美学向量融合,候选物品可被表示在共享嵌入空间中进行排序。在真实世界评估集 Aesthetic-100 上的实验表明,TATTOO 相较于现有基于训练的方法实现了状态-of-the-art 性能。另一个标准数据集 Polyvore 也用于衡量该无训练方法的先进零样本检索能力。

关键词

引用

@article{arxiv.2509.23242,
  title  = {TATTOO: Training-free AesTheTic-aware Outfit recOmmendation},
  author = {Yuntian Wu and Xiaonan Hu and Ziqi Zhou and Hao Lu},
  journal= {arXiv preprint arXiv:2509.23242},
  year   = {2025}
}

备注

4 figures, 4 tables