中文

机器学习软件中的失真与缺陷

机器学习 2019-11-27 v1

摘要

机器学习软件,尤其是深度神经网络(DNN)软件,从大型数据集(一组数据的集合)中辨识出有价值的信息。此类 DNN 程序的输出依赖于学习程序与数据集两者的质量。遗憾的是,数据集的质量难以界定,因为它们仅仅是样本。DNN 软件的质量保证十分困难,因为训练所得的机器学习模型在开发前是未知的,且验证是通过预测性能间接进行的。本文提出一个假设:学习程序中的缺陷会表现为训练所得机器学习模型中的失真。利用适当的观测函数所测得的相对失真程度,可能表明存在某些隐藏的缺陷。该提议通过 MNIST 数据集的示例案例加以演示。

关键词

引用

@article{arxiv.1911.11596,
  title  = {Distortion and Faults in Machine Learning Software},
  author = {Shin Nakajima},
  journal= {arXiv preprint arXiv:1911.11596},
  year   = {2019}
}

备注

Presented at the 9th SOFL+MSVL Workshop in Shenzhen, November 2019