中文

FashionMV: 基于多视角时尚数据的产品级组合图像检索

信号处理 2026-04-14 v1

摘要

组合图像检索 (CIR) 使用带有修改文本的参考图像检索目标图像. 尽管取得了快速进展, 但所有现有方法和数据集都在图像级别运行--一个参考图像加上修改文本输入, 一个目标图像输出--而现实电商用户会对从多个视角展示的产品进行推理. 我们称之为视角不完整 (View Incompleteness), 并正式定义一种新的多视角 CIR 任务, 将标准 CIR 从图像级别推广到产品级别检索. 为支持这一任务, 我们构建了 FashionMV, 第一个大规模多视角时尚数据集用于产品级 CIR, 包含 127K 个产品, 472K 个多视角图像, 以及超过 220K 个 CIR 三元组, 通过完全自动化的管道构建, 利用大型多模态模型. 我们进一步提出了 ProCIR (产品级组合图像检索), 一个建立在多模态大语言模型之上的建模框架, 使用三个互补机制--两阶段对话、基于说明的对齐和链式思维指导--以及可选的监督微调 (SFT) 阶段在对比学习前注入结构化产品知识. 在三个时尚基准上的 16 种配置的系统消融研究表明: (1) 对齐是最关键的机制; (2) 两阶段对话架构是有效对齐的必要条件; (3) SFT 和链式思维作为部分冗余的知识注入路径. 我们最好的 0.8B 参数模型超越了所有基线, 包括其规模是其 10 倍的通用嵌入模型. 数据集、模型和代码均可公开获取于 https://github.com/yuandaxia2001/FashionMV.

关键词

引用

@article{arxiv.2604.10296,
  title  = {DBU-OFDM: A Trainable Deep Block-Unitary OFDM Waveform for Integrated Sensing and Communication},
  author = {Cheng Luo and Luping Xiang and Hankun Zhang and Yi Luo and Chen Huang and Yi Zhang and Cheng-Xiang Wang and Kun Yang},
  journal= {arXiv preprint arXiv:2604.10296},
  year   = {2026}
}