中文

面向 LLM 产品属性值抽取的自我精炼策略

计算与语言 2025-02-17 v2

摘要

结构化产品数据(属性值对形式)是电子商务平台实现面向属性的产品搜索和属性比较等功能的关键。然而,供应商常提供非结构化的产品描述,使得属性值抽取成为必要,以确保数据一致性和可用性。大型语言模型(Large Language Model, LLM)在零样本场景下展现出在产品属性值抽取方面的潜力。近期研究表明,自我精炼技术可提升 LLM 在代码生成和文本到 SQL 转换等任务上的性能。然而,对于其他任务,这些技术的结果是增加额外标记代价,却未实现性能提升。本文探讨了将两种自我精炼技术(基于错误的提示词重写和自我纠正)应用于产品属性值抽取任务。我们在零样本、few-shot 场景以及微调情境下使用 GPT-4o 评估了这些自我精炼技术。实验结果表明,这两种自我精炼技术均未显著提升抽取性能,却大幅增加了处理成本。在开发数据可用的场景下,微调方案能获得最佳性能;随着产品描述数量的增加,微调的上升成本将逐步被平衡。

关键词

引用

@article{arxiv.2501.01237,
  title  = {Self-Refinement Strategies for LLM-based Product Attribute Value Extraction},
  author = {Alexander Brinkmann and Christian Bizer},
  journal= {arXiv preprint arXiv:2501.01237},
  year   = {2025}
}