MAVE:一个用于多源属性值抽取的商品数据集
计算与语言
2021-12-17 v1 信息检索
摘要
属性值抽取是指从商品信息中识别感兴趣属性的取值的任务。商品属性值在众多电商场景(如客服机器人、商品排序、检索与推荐)中至关重要。然而在现实世界中,商品的属性值通常不完整且随时间变化,这极大阻碍了实际应用。本文介绍 MAVE,一个用于更好推动商品属性值抽取研究的新数据集。MAVE 由来自 Amazon 页面的 220 万件精筛商品组成,涵盖 1257 个独特品类,包含 300 万条属性-值标注。MAVE 具有四个主要且独特的优势:第一,按属性-值样本数量计,MAVE 是最大的商品属性值抽取数据集。第二,MAVE 包含来自商品的多源表示,以高属性覆盖度捕获完整商品信息。第三,相较已有数据集,MAVE 覆盖了更多样化的属性与取值。最后,如我们在实验中经验性展示的,MAVE 提供了一个极具挑战性的零样本测试集。我们进一步提出一种从多源商品信息中有效抽取属性值的新方法。我们使用若干基线进行大量实验,表明 MAVE 是属性值抽取任务的有效数据集,同时零样本属性抽取也是一项极具挑战性的任务。数据可在 {\it \url{https://github.com/google-research-datasets/MAVE}} 获取。
引用
@article{arxiv.2112.08663,
title = {MAVE: A Product Dataset for Multi-source Attribute Value Extraction},
author = {Li Yang and Qifan Wang and Zac Yu and Anand Kulkarni and Sumit Sanghai and Bin Shu and Jon Elsas and Bhargav Kanagal},
journal= {arXiv preprint arXiv:2112.08663},
year = {2021}
}
备注
10 pages, 7 figures. Accepted to WSDM 2022. Dataset available at https://github.com/google-research-datasets/MAVE