中文

FOLD-R++:一个用于从混合数据自动归纳学习默认理论的可扩展工具集

机器学习 2022-02-15 v3

摘要

FOLD-R是一种用于从混合(数值和分类)数据中学习默认规则的自动归纳学习算法。它为分类任务生成一个(可解释的)答案集编程(ASP)规则集。我们提出了一种改进的FOLD-R算法,称为FOLD-R++,它将FOLD-R的效率和可扩展性显著提高了数个数量级。FOLD-R++在编码或特征选择阶段改进了FOLD-R,且不会损害或丢失输入训练数据中的信息。FOLD-R++算法在性能上与广泛使用的XGBoost算法具有竞争力,然而,与XGBoost不同,FOLD-R++算法产生一个可解释的模型。FOLD-R++在性能上也与RIPPER系统具有竞争力,然而,在大型数据集上,FOLD-R++优于RIPPER。我们还通过将FOLD-R++与s(CASP)——一个目标驱动的ASP执行引擎——相结合,创建了一个强大的工具集,以使用FOLD-R++生成的答案集程序对新数据样本进行预测。s(CASP)系统还会为预测生成一个解释。本文展示的实验表明,我们改进的FOLD-R++算法是对原始设计的显著改进,并且s(CASP)系统也能以高效的方式进行预测。

关键词

引用

@article{arxiv.2110.07843,
  title  = {FOLD-R++: A Scalable Toolset for Automated Inductive Learning of Default Theories from Mixed Data},
  author = {Huaduo Wang and Gopal Gupta},
  journal= {arXiv preprint arXiv:2110.07843},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:1909.09017 by other authors