HardVis:利用欠采样与过采样技术处理样本难度的可视分析系统
机器学习
2024-04-19 v4 人机交互
机器学习
摘要
尽管机器学习(ML)取得了巨大进展,在不平衡数据上训练在许多实际应用中仍存在挑战。在解决该问题的一系列多样化技术中,采样算法被视为一种高效的解决方案。然而,问题更为根本,许多工作强调了样本难度(instance hardness)的重要性。该问题指的是处理那些更可能被误分类、并作为分类性能不佳根本原因的不安全或潜在含噪样本的重要性。本文介绍了 HardVis,一个主要用于不平衡分类场景中处理样本难度的可视分析系统。我们提出的系统帮助用户直观地比较不同数据类型分布,基于局部特征选择稍后将受主动采样方法影响的样本类型,并验证来自欠采样或过采样技术的哪些建议对 ML 模型有益。此外,不同于对特定类别统一进行欠采样/过采样,我们允许用户从所有类别中查找并采样易于和难以分类的训练样本。用户可从不同视角探索数据子集以决定所有这些参数,而 HardVis 会记录其操作步骤,并在独立的测试集上评估模型的预测性能。最终得到一个良好平衡的数据集,提升了 ML 模型的预测能力。HardVis 的功效与有效性通过一个假设使用场景和一个用例得以展示。最后,我们还基于从 ML 专家处获得的反馈考察了系统的实用性。
引用
@article{arxiv.2203.15753,
title = {HardVis: Visual Analytics to Handle Instance Hardness Using Undersampling and Oversampling Techniques},
author = {Angelos Chatzimparmpas and Fernando V. Paulovich and Andreas Kerren},
journal= {arXiv preprint arXiv:2203.15753},
year = {2024}
}
备注
This manuscript is accepted for publication in Computer Graphics Forum (CGF)