中文

利用 LLM 提取与规范化产品属性值

计算与语言 2024-09-04 v4

摘要

电子商务网站上的商品报价通常由产品标题和文本产品描述组成。为了实现分面产品搜索或生成产品比较表等功能,有必要从非结构化的产品标题和描述中提取结构化的属性-值对,并将提取的值规范化为每个属性的统一标度。本文探讨了使用大型语言模型(LLM)(如 GPT-3.5 和 GPT-4)从产品标题和描述中提取并规范化属性值的潜力。我们尝试了不同的零样本和少样本提示模板,以指导 LLM 提取并规范化属性-值对。我们为实验引入了 Web Data Commons - Product Attribute Value Extraction (WDC-PAVE) 基准数据集。WDC-PAVE 包含来自 59 个不同网站的商品报价,这些网站提供了 schema.org 标注。这些报价属于五个不同的产品类别,每个类别具有特定的属性集。该数据集以两种形式提供了人工验证的属性-值对:(i) 直接提取的值和 (ii) 规范化的属性值。属性值的规范化要求系统执行以下类型的操作:名称扩展、泛化、测量单位转换和字符串整理。我们的实验表明,GPT-4 的表现优于基于 PLM 的提取方法 SU-OpenTag、AVEQA 和 MAVEQA 10%,达到了 91% 的 F1 分数。对于产品属性值的提取和规范化,GPT-4 取得了与提取场景相似的性能,并且在字符串整理和名称扩展方面表现尤为出色。

关键词

引用

@article{arxiv.2403.02130,
  title  = {Using LLMs for the Extraction and Normalization of Product Attribute Values},
  author = {Alexander Brinkmann and Nick Baumann and Christian Bizer},
  journal= {arXiv preprint arXiv:2403.02130},
  year   = {2024}
}

备注

The paper has been accepted at ADBIS2024