一图胜千言:利用预训练图像到文本模型增强商品检索
信息检索
2024-02-14 v1
摘要
本文探讨了利用多模态图像到文本模型来增强基于文本的商品检索。我们提议利用预训练的图像描述生成和标签模型(如 instructBLIP 和 CLIP)来生成基于文本的商品描述,并将其与现有的文本描述相结合。我们的工作对于无法维持高质量文本描述以有效执行搜索和推荐用例中商品检索的小型电子商务企业尤为具有影响力。我们在 Amazon 公开可用的 ESCI 数据集的几个子集上,评估了真实文本、图像生成文本以及两者组合的可搜索性。结果表明,我们提出的模型具有双重能力:既能增强现有文本的检索,又能生成高度可搜索的独立描述。
引用
@article{arxiv.2402.08532,
title = {Captions Are Worth a Thousand Words: Enhancing Product Retrieval with Pretrained Image-to-Text Models},
author = {Jason Tang and Garrin McGoldrick and Marie Al-Ghossein and Ching-Wei Chen},
journal= {arXiv preprint arXiv:2402.08532},
year = {2024}
}
备注
The 3rd International Workshop on Interactive and Scalable Information Retrieval Methods for E-Commerce (ISIR-eCom 2024) Held in conjunction with ACM WSDM - March 8th, 2024