中文

提高货运方式选择模型精度:基于2017年CFS PUF数据集和集成学习技术的案例研究

机器学习 2024-02-13 v2

摘要

美国人口普查局从商品流量调查中收集了两轮实验数据,提供了全国商品流动的货运层面特征,分别于2012年(即公共使用微数据)和2017年(即公共使用文件)发布。借助这些信息,数据驱动方法对于理解货运物流的详细模式变得越来越有价值。在本研究中,我们使用2017年商品流量调查公共使用文件数据集,探索构建高性能的货运方式选择模型,考虑了三个主要改进:(1)为每个单独的商品/行业类别构建局部模型;(2)提取有用的地理特征,特别是每种货运方式在起讫区域之间的导出距离;(3)应用额外的集成学习方法,如堆叠或投票,以结合局部和统一模型的结果来提高性能。所提出的方法在不引入外部信息的情况下达到了超过92%的准确率,相比直接在10,000个样本上拟合随机森林模型提高了19%以上。此外,计算了SHAP(Shapley加法解释)值来解释从所提出模型获得的输出和主要模式。该模型框架可以提高现有货运方式选择模型的性能和可解释性。

关键词

引用

@article{arxiv.2402.00654,
  title  = {Improving the accuracy of freight mode choice models: A case study using the 2017 CFS PUF data set and ensemble learning techniques},
  author = {Diyi Liu and Hyeonsup Lim and Majbah Uddin and Yuandong Liu and Lee D. Han and Ho-ling Hwang and Shih-Miao Chin},
  journal= {arXiv preprint arXiv:2402.00654},
  year   = {2024}
}