中文

一种分类方法是否足够好?面向分类学习的拟合优度评估工具

机器学习 2022-02-03 v3 机器学习

摘要

近年来,随机森林、Boosting、神经网络等许多非传统分类方法已广泛应用于实际问题中。其性能通常以分类准确率来衡量。尽管分类错误率及类似指标十分重要,但它们未能解决一个根本问题:该分类方法是否存在欠拟合?据我们所知,目前尚无方法能够评估一般分类过程的拟合优度。事实上,由于缺乏参数假设,构建适当的检验十分困难。为克服这一困难,我们提出了一种称为 BAGofT 的方法,将数据划分为训练集与验证集。首先,将待评估的分类过程应用于训练集,并借此自适应地寻找能揭示最严重欠拟合区域的数据分组。然后,基于该分组,我们通过比较验证集中估计的成功概率与实际观测响应来计算检验统计量。数据划分保证了在原假设下检验的显著性水平受控,而在备择假设下随着样本量增大检验的功效趋于 1。对于参数分类模型的检验,BAGofT 比现有方法适用范围更广,因为它不局限于特定的参数模型(如 logistic regression)。大量模拟研究表明,BAGofT 在评估一般分类过程时具有实用性,并且在检验参数分类模型时优于一些现有方法。

关键词

引用

@article{arxiv.1911.03063,
  title  = {Is a Classification Procedure Good Enough? A Goodness-of-Fit Assessment Tool for Classification Learning},
  author = {Jiawei Zhang and Jie Ding and Yuhong Yang},
  journal= {arXiv preprint arXiv:1911.03063},
  year   = {2022}
}