中文

扩展 CLIP 用于电商中类目到图像的检索

信息检索 2022-01-05 v2 机器学习 多媒体

摘要

电子商务提供了丰富的多模态数据,但在实践中极少被利用。此类数据的一个方面是在搜索与推荐中使用的类目树。然而在实践中,用户会话期间给定类目的文本表示与视觉表示常存在不匹配。受该问题驱动,我们引入了电商中类目到图像检索的任务,并针对该任务提出模型 CLIP-ITA。该模型利用多模态(文本、视觉与属性模态)信息来构建商品表示。我们探究了添加多模态(文本、视觉与属性模态)信息如何影响模型性能。特别地,我们观察到 CLIP-ITA 显著优于仅利用视觉模态的可比模型,以及利用视觉与属性模态的可比模型。

关键词

引用

@article{arxiv.2112.11294,
  title  = {Extending CLIP for Category-to-image Retrieval in E-commerce},
  author = {Mariya Hendriksen and Maurits Bleeker and Svitlana Vakulenko and Nanne van Noord and Ernst Kuiper and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2112.11294},
  year   = {2022}
}

备注

15 pages, accepted as a full paper at ECIR 2022