有限样本下机器学习模型的测试:一种工业真空泵应用
软件工程
2022-08-09 v1
摘要
在工业生产中,机器学习(ML)分类与回归模型的训练数据常常匮乏,尤其是对于耗时的或稀疏运行的制造过程。有限的真实标注数据大部分用于训练,仅留下少量样本用于测试。此处,测试样本数量不足以恰当评估待测分类与回归ML模型的鲁棒性。此外,若输入数据偏离预期,这些ML模型的输出可能不准确甚至失效。精炼钢工业中电渣重熔(ESR)过程用于预测真空室压力的ML模型即属此情形。每个工作日发生一次的真空泵事件在一年泵送中仅生成数百个用于训练与测试的样本。在缺乏充足训练与测试样本的情况下,本文首先提出一种基于真空泵原理生成一组新增强样本的方法。基于生成的增强样本,提出三种测试场景与一个测试预言以评估工业规模生产所用ML模型的鲁棒性。实验使用来自Uddeholms AB钢铁公司的真实工业生产数据开展。评估表明,采用所提测试策略在增强数据上训练时,集成模型与神经网络最为鲁棒。评估还证明了所提方法在此类情形下检查并提升ML算法鲁棒性的有效性。该工作推进了类似环境下软件测试领域中鲁棒性测试的最先进水平。最后,本文给出了所提方法的MLOps实现,用于在边缘节点上进行实时ML模型预测与动作,以及从云端自动化持续交付ML软件。
引用
@article{arxiv.2208.04062,
title = {Testing of Machine Learning Models with Limited Samples: An Industrial Vacuum Pumping Application},
author = {Ayan Chatterjee and Bestoun S. Ahmed and Erik Hallin and Anton Engman},
journal= {arXiv preprint arXiv:2208.04062},
year = {2022}
}
备注
11 pages