中文

美国住户在线购物需求建模:一种机器学习方法及 2009 与 2017 年的比较研究

机器学习 2021-01-12 v1

摘要

尽管在线购物快速增长且学界对线上与店内购物关系兴趣浓厚,但文献中以预测为导向、对国家层面在线购物需求进行建模与调查的研究仍然有限。本文有别于既往工作,利用美国 2009 年与 2017 年两期最新发布的全国家庭旅行调查(NHTS)数据,开发机器学习(ML)模型,具体而言为梯度提升机(GBM),用于预测住户层面的在线购物购买量。NHTS 数据不仅支持全国范围调查,也支持住户层面调查,鉴于住户成员间相连的消费需求与购物需要,这比个体层面更为合适。我们遵循系统的模型开发流程,包括采用递归特征消除算法筛选输入变量(特征),以降低模型过拟合风险并提升可解释性。我们开展了广泛的建后比较调查,涵盖 2009 与 2017 年,包括量化各输入变量在预测在线购物需求中的重要性,以及刻画需求与输入变量间取值依赖的关系。为此,采用了两项机器学习最新进展,即基于 Shapley 值的特征重要性与累积局部效应图,以克服当前 ML 建模中流行技术的内在缺陷。建模与调查在全国层面及三个最大城市(纽约、洛杉矶、休斯顿)展开。所开发的模型与获得的洞见可用于在线购物相关的货运需求生成,也可用于评估相关政策对在线购物需求的潜在影响。

关键词

引用

@article{arxiv.2101.03690,
  title  = {Modeling Household Online Shopping Demand in the U.S.: A Machine Learning Approach and Comparative Investigation between 2009 and 2017},
  author = {Limon Barua and Bo Zou and Yan and Zhou and Yulin Liu},
  journal= {arXiv preprint arXiv:2101.03690},
  year   = {2021}
}