中文

用于文本引导时尚图像检索的模型训练与挑战

计算机视觉与模式识别 2022-04-26 v1

摘要

基于查询图像及修改性文本描述从目录中检索相关图像是一项具有挑战性的多模态任务,尤其有益于服装购物等领域,其中精细细节与微妙差异最好通过自然语言来表达。我们引入了一个新的评估数据集Challenging Fashion Queries(CFQ),以及一种在现有Fashion IQ(FIQ)数据集上达到最先进性能的建模方法。CFQ通过包含带有标题准确性正标签与负标签以及条件图像相似性的相对标题来补充现有基准,而其他基准仅提供具有组合含义的正标签。我们展示了多模态预训练对该任务的重要性,并表明基于属性标签的特定领域弱监督可以增强通用的规模化预训练。此前的模态融合机制丧失了多模态预训练的优势,我们引入了一种残差注意力融合机制以提升性能。我们向研究界发布了CFQ及我们的代码。

关键词

引用

@article{arxiv.2204.11004,
  title  = {Training and challenging models for text-guided fashion image retrieval},
  author = {Eric Dodds and Jack Culpepper and Gaurav Srivastava},
  journal= {arXiv preprint arXiv:2204.11004},
  year   = {2022}
}