工业 4.0 中基于范例聚类的有意义数据摘要生成
分布式、并行与集群计算
2021-06-22 v2 人工智能
摘要
数据摘要是从大数据流中提取知识的宝贵工具,并已在大量应用中证明其效用。可通过优化次模函数找到摘要。这些函数将数据的子集映射为实数值,指示其“代表性”,并应被最大化以找出底层数据的多样化摘要。本文中,我们将基于范例的聚类作为次模函数进行研究,并给出一种 GPU 算法以应对其高计算复杂度。我们表明,相较传统 CPU 算法,我们的 GPU 实现在单精度下提供高达 72 倍加速,在半精度计算下高达 452 倍加速。我们还表明,该 GPU 算法不仅在工作站级 GPU 上提供显著运行时间收益,在低功耗嵌入式计算单元上亦有可能达到高达 35 倍加速。此外,我们将算法应用于注塑制造过程的真实世界数据,并讨论所得摘要如何帮助调控该特定过程以削减成本并减少不良部件的生产。除纯加速考量外,我们表明我们的方法能在此类工业真实世界数据的合理时间范围内提供摘要。
引用
@article{arxiv.2105.12026,
title = {Providing Meaningful Data Summarizations Using Exemplar-based Clustering in Industry 4.0},
author = {Philipp-Jan Honysz and Alexander Schulze-Struchtrup and Sebastian Buschjäger and Katharina Morik},
journal= {arXiv preprint arXiv:2105.12026},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2101.08763