利用部分标注数据进行产品属性值识别的框架
计算与语言
2024-11-19 v2 人工智能
信息检索
机器学习
摘要
在电商领域,从产品标题和用户搜索查询中准确提取属性值对(例如 Brand: Apple)对于增强搜索和推荐系统至关重要。神经模型在此任务上的一个主要挑战是缺乏高质量训练数据,因为现有数据集中属性值对的标注往往不完整。为此,我们引入了 GenToC 模型,旨在直接使用部分标注数据进行训练,无需完全标注的数据集。GenToC 采用标记增强的生成模型以识别潜在属性,然后通过标记分类模型确定每个属性关联的值。GenToC 在准确提取数量上超越了现有的领先模型,提升最高可达 56.3%。此外,我们利用 GenToC 重新生成训练数据集以扩展属性值标注。这一自助方法在提高训练其他标准命名实体识别模型数据质量方面发挥作用,这些模型通常更快,但在处理部分标注数据方面能力较弱,使其能够实现与 GenToC 相当的性能。我们的结果表明,GenToC 能够从有限的部分标注数据中学习,并提升更高效模型的训练,从而推动属性值对的自动提取。最后,我们的模型已成功集成到印度最大的 B2B 电商平台 IndiaMART,在现有部署系统中正确识别属性值对的数量提升了 20.2%,且精度达到 89.5%。
引用
@article{arxiv.2405.10918,
title = {A Framework for Leveraging Partially-Labeled Data for Product Attribute-Value Identification},
author = {D. Subhalingam and Keshav Kolluru and Mausam and Saurabh Singal},
journal= {arXiv preprint arXiv:2405.10918},
year = {2024}
}
备注
Accepted to KDD 2025 ADS Track