中文

多少数据才足够?一种统计方法及纵向驾驶行为案例研究

机器学习 2017-06-26 v1

摘要

大数据已展现出其揭示、建模和理解驾驶员行为的独特强大能力。数据量会影响分析中的实验成本和结论。数据不足可能导致模型不准确,而数据过多则浪费资源。对于耗资数百万美元的项目而言,确定所需的数据量至关重要。然而,在驾驶员行为领域,如何决定合适的数据量尚未得到充分研究。本文系统地研究了这一问题,从统计学角度估计理解驾驶员行为所需的自然驾驶数据(NDD)量。提出了一种通用评估方法,使用高斯核密度估计来捕捉驾驶员行为的潜在特征。随后,我们应用 Kullback-Leibler 散度方法来测量具有不同 NDD 量的密度函数之间的相似度。采用极大-极小方法计算合适的 NDD 量。为了验证我们提出的方法,我们使用从密歇根大学安全试点模型部署(SPMD)项目收集的 NDD 调查了跟驰案例。我们证明,从统计角度来看,所提出的方法能够提供适当数量的 NDD,足以捕捉正常跟驰行为的大部分特征,这与许多文献中的实验设置一致。

关键词

引用

@article{arxiv.1706.07637,
  title  = {How Much Data is Enough? A Statistical Approach with Case Study on Longitudinal Driving Behavior},
  author = {Wenshuo Wang and Chang Liu and Ding Zhao},
  journal= {arXiv preprint arXiv:1706.07637},
  year   = {2017}
}