从非结构化多语言网络数据自动抽取细粒度标准化产品信息
信息检索
2023-02-24 v1 人工智能
机器学习
摘要
从非结构化数据中提取结构化信息是现代信息检索应用(包括电子商务)中的关键挑战之一。在此,我们展示了近期机器学习进展,结合新近发布的多语言数据集(含标准化细粒度产品类别信息),如何在具有挑战性的迁移学习设定中实现稳健的产品属性抽取。我们的模型能够跨在线商店、跨语言或同时跨两者可靠预测产品属性。此外,我们表明我们的模型可用于匹配不同在线零售商之间的产品分类体系。
引用
@article{arxiv.2302.12139,
title = {Automated Extraction of Fine-Grained Standardized Product Information from Unstructured Multilingual Web Data},
author = {Alexander Flick and Sebastian Jäger and Ivana Trajanovska and Felix Biessmann},
journal= {arXiv preprint arXiv:2302.12139},
year = {2023}
}
备注
ECIR 2023 Demo Track