多语言亚马逊评论语料库
计算与语言
2020-10-07 v1 信息检索
机器学习
摘要
我们提出多语言亚马逊评论语料库(MARC),一个用于多语言文本分类的大规模亚马逊评论集合。该语料库包含英语、日语、德语、法语、西班牙语和汉语的评论,收集于 2015 至 2019 年。数据集中的每条记录包含评论文本、评论标题、星评、匿名化评论者 ID、匿名化产品 ID 以及粗粒度产品类别(如“书籍”、“家电”等)。语料库在 5 种可能的星评上保持平衡,因此每种评分在各语言中占评论的 20%。每种语言在训练、开发与测试集中分别有 200,000、5,000 和 5,000 条评论。我们通过在评论数据上微调多语言 BERT 模型,给出了监督文本分类与零样本跨语言迁移学习的基线结果。我们提议在此任务中使用平均绝对误差(MAE)而非分类准确率,因为 MAE 考虑了评分的序数性质。
引用
@article{arxiv.2010.02573,
title = {The Multilingual Amazon Reviews Corpus},
author = {Phillip Keung and Yichao Lu and György Szarvas and Noah A. Smith},
journal= {arXiv preprint arXiv:2010.02573},
year = {2020}
}
备注
To appear in EMNLP 2020