面向机器学习软件的不可设想测试数据生成
软件工程
2020-05-22 v1 机器学习
摘要
对于通过机器学习进行的软件开发,训练好的模型使用现有数据集的一部分作为测试数据进行评估。然而,如果输入具有与现有数据不同特征的数据,模型并不总是如预期那样行为。因此,为了更严格地确认模型的行为,有必要创建不同于现有数据的数据并用该不同数据测试模型。待测数据不仅包括开发者能够设想的数据(可设想数据),也包括其无法设想的数据(不可设想数据)。为了严格确认模型行为,尽可能多地创建不可设想数据十分重要。因此,本研究提出一种称为“不可设想测试数据生成”(UTG)的方法——用于向模型开发者和测试者提供关于不可设想数据的建议。UTG使用变分自编码器(VAE)来生成不可设想数据。通过获取VAE先验分布中低出现概率的潜变量并将获取的潜变量输入解码器来生成不可设想数据。如果解码器生成的数据中包含不可设想数据,开发者可通过参考该数据识别新的不可设想特征。基于这些不可设想特征,开发者将能够创建具有同样特征的其他不可设想数据。所提出的UTG被应用于MNIST数据集和House Sales Price数据集。结果证明了UTG的可行性。
引用
@article{arxiv.2005.10442,
title = {Unsupposable Test-data Generation for Machine-learned Software},
author = {Naoto Sato and Hironobu Kuruma and Hideto Ogawa},
journal= {arXiv preprint arXiv:2005.10442},
year = {2020}
}