中文

PyHard:一种生成难度嵌入以支持以数据为中心的分析的新工具

机器学习 2021-09-30 v1 人机交互

摘要

为了构建成功的机器学习(ML)系统,必须拥有高质量的数据和充分调优的学习模型。但是,如何评估给定数据集的质量?又如何揭示模型在数据集上的优势与劣势?我们的新工具 PyHard 采用一种称为实例空间分析(ISA)的方法,生成数据集的难度嵌入,将多个 ML 模型的预测性能与估计的实例难度元特征相关联。该空间的构建使得观测值根据其分类难度的不同呈线性分布。用户可以通过多种方式与此嵌入进行可视化交互,并沿数据集的各个观测获取关于数据和算法性能的有用见解。我们在一个 COVID 预后数据集中展示了该分析如何支持识别挑战 ML 模型且值得进一步检查的困难观测簇,以及划定 ML 模型的优势与劣势区域。

关键词

引用

@article{arxiv.2109.14430,
  title  = {PyHard: a novel tool for generating hardness embeddings to support data-centric analysis},
  author = {Pedro Yuri Arbs Paiva and Kate Smith-Miles and Maria Gabriela Valeriano and Ana Carolina Lorena},
  journal= {arXiv preprint arXiv:2109.14430},
  year   = {2021}
}