中文

计算规则列表的优良模型集合

机器学习 2022-04-26 v1

摘要

自 Breiman 于 2001 年发表开创性论文指出从可解释 AI 视角看预测多重性的潜在危害以来,对所有优良模型集合(亦称“Rashomon 集”)的全局分析近年来备受关注。由于寻找此类优良模型集合是困难的计算问题,迄今仅有少数算法解决该问题,且大多为近似或不完备的。为克服此困难,我们研究对一类称为规则列表的可解释模型的全部优良模型的高效枚举。基于 Angelino 等人 2017 年提出的最先进最优规则列表学习器 CORELS,我们提出一种高效枚举算法 CorelsEnum,用于在给定数据集与相对最优模型的误差容忍度下,利用关于输入规模的多项式空间精确计算所有优良模型的集合。通过在再犯预测 COMPAS 数据集上的实验,我们的算法 CorelsEnum 在约 1,000 秒内成功枚举了长度至多 =3\ell = 3 的数万个优良规则列表中的全部,而 Hara 与 Ishihata 于 2018 年提出的基于 Lawler 方法与 CORELS 结合的最先进 top-KK 规则列表学习器在 6,000 秒超时前仅找到 40 个模型。对于全局分析,我们进行了刻画 Rashomon 集的实验,并观察到模型在预测多重性与模型公平性方面具有高度多样性。

关键词

引用

@article{arxiv.2204.11285,
  title  = {Computing the Collection of Good Models for Rule Lists},
  author = {Kota Mata and Kentaro Kanamori and Hiroki Arimura},
  journal= {arXiv preprint arXiv:2204.11285},
  year   = {2022}
}

备注

16 pages, 4 Figures, to applear in the 18th International Conference on Machine Learning and Data Mining (MLDM 2022 ), July 16 - 21, 2022, New York, USA