中文

面向简约且可解释预测模型的特征量化

统计方法学 2019-03-22 v1 计量经济学

摘要

出于监管与可解释性原因,逻辑回归仍被广泛使用。为提高预测精度与可解释性,通常执行一个对连续型与分类型数据均进行量化的预处理步骤:连续特征被离散化,若数量众多,则分类型特征的水平被分组。通过将此量化估计步骤直接嵌入预测估计步骤本身,可达到更佳的预测精度。但如此一来,预测损失须在一个巨大集合上优化。为克服该困难,我们引入一种特定的两步优化策略:首先,用光滑函数逼近不连续量化函数以松弛优化问题;其次,通过一种特定的神经网络求解所得松弛优化问题。我们称之为 glmdisc 的该方法在来自 UCI 库与 Crédit Agricole Consumer Finance(欧洲消费信贷市场的主要历史参与者)的模拟与真实数据上展示了良好性能。

关键词

引用

@article{arxiv.1903.08920,
  title  = {Feature quantization for parsimonious and interpretable predictive models},
  author = {Adrien Ehrhardt and Christophe Biernacki and Vincent Vandewalle and Philippe Heinrich},
  journal= {arXiv preprint arXiv:1903.08920},
  year   = {2019}
}

备注

9 pages, 2 figures, 3 tables