面向电商地址分类的深度上下文嵌入方法
机器学习
2020-07-08 v1 计算与语言
信息检索
机器学习
摘要
印度等发展中国家的电商客户在填写收货地址时往往不遵循固定格式。由于缺乏内在结构或层级,解析此类地址具有挑战性。理解地址的语言至关重要,以便包裹能够无误送达。在本文中,我们受自然语言处理(NLP)近期进展的启发,提出了一种理解客户地址的新方法。我们还利用编辑距离与语音算法的组合为地址制定了不同的预处理步骤。随后,我们使用 Word2Vec 结合 TF-IDF、Bi-LSTM 以及基于 BERT 的方法来完成地址向量表示的构建任务。我们针对印度北部与南部城市的子区域分类任务对这些方法进行了比较。通过实验,我们证明了在大型地址语料库上为语言建模任务预训练的广义 RoBERTa 模型的有效性。我们所提出的 RoBERTa 模型在子区域分类任务中以极少的文本预处理实现了约 90% 的分类准确率,优于所有其他方法。一旦预训练完成,该 RoBERTa 模型可针对供应链中的多种下游任务(如邮编建议与地理编码)进行微调。即使在有限标注数据下,该模型在此类任务上也能良好泛化。据我们所知,这是首例提出通过预训练语言模型并微调用于不同目的来理解电商领域客户地址的新方法的同类研究。
引用
@article{arxiv.2007.03020,
title = {Deep Contextual Embeddings for Address Classification in E-commerce},
author = {Shreyas Mangalgi and Lakshya Kumar and Ravindra Babu Tallamraju},
journal= {arXiv preprint arXiv:2007.03020},
year = {2020}
}
备注
9 Pages, 8 Figures, AI for fashion supply chain, KDD2020 Workshop