中文

视觉零样本电商产品属性值提取

信息检索 2025-02-25 v1 计算机视觉与模式识别

摘要

现有电商行业的零样本产品属性值(aspect)提取方法依赖单模态或多模态模型,需要卖家为产品提供详细的文本输入(产品描述)。然而,手动输入产品描述对卖家来说既耗时又让人沮丧。因此,我们提出一种基于 CLIP 的跨模态零样本属性值生成框架(ViOC-AG),仅需产品图像作为输入。ViOC-AG 采用仅文本训练流程,训练一个任务定制的文本解码器以冻结的 CLIP 文本编码器为输入,以缓解模态差距和任务断层。在零样本推理期间,产品属性由连接已训练任务定制文本解码器的冻结 CLIP 图像编码器生成。OCR 标记和来自冻结提示基 LLM 的输出用于纠正超出域属性值的解码输出。实验表明,ViOC-AG 在零样本属性值提取方面显著优于其他微调视觉语言模型。

关键词

引用

@article{arxiv.2502.15979,
  title  = {Visual Zero-Shot E-Commerce Product Attribute Value Extraction},
  author = {Jiaying Gong and Ming Cheng and Hongda Shen and Pierre-Yves Vandenbussche and Janet Jenq and Hoda Eldardiry},
  journal= {arXiv preprint arXiv:2502.15979},
  year   = {2025}
}

备注

10 pages, 4 figures, accepted for publication in NAACL 2025 Industry Track