中文

邻域特征有助于在大数据集中检测非技术损失

机器学习 2017-07-26 v2 人工智能

摘要

窃电在世界各地无论是发达国家还是发展中国家都是一个主要问题,其比例可能高达总配电量的40%。更一般地,窃电属于非技术损失(NTL),即在电网配电过程中发生的损失。在本文中,我们从客户的邻域构建特征。我们首先将客户所在的区域划分为不同大小的网格。然后对于每个网格单元,我们计算被检查客户的比例以及在被检查客户中发现NTL的比例。然后我们分析生成特征的分布,并说明为什么它们对预测NTL是有用的。此外,我们从客户的消费时间序列中计算特征。我们还使用了客户的主数据特征,例如他们的客户类别和连接电压。我们针对包含31M仪表读数、700K客户和400K检查结果的大数据库计算这些特征。然后我们使用这些特征来训练四种由于其可并行化结构而特别适合大数据集的机器学习算法:逻辑回归、k近邻、线性支持向量机和随机森林。使用邻域特征而不是仅分析时间序列,在NTL比例为1%-90%的不同情况下,对大数据集产生了显著的结果。因此,这项工作可以部署到世界各地广泛的不同区域。

关键词

引用

@article{arxiv.1607.00872,
  title  = {Neighborhood Features Help Detecting Non-Technical Losses in Big Data Sets},
  author = {Patrick Glauner and Jorge Meira and Lautaro Dolberg and Radu State and Franck Bettinger and Yves Rangoni and Diogo Duarte},
  journal= {arXiv preprint arXiv:1607.00872},
  year   = {2017}
}

备注

Proceedings of the 3rd IEEE/ACM International Conference on Big Data Computing Applications and Technologies (BDCAT 2016)