中文

通过量化梯度下降在强盗反馈下学习精确决策树

机器学习 2022-10-03 v3

摘要

决策树提供了一类丰富且高度非线性但高效的模型,因此仍是各领域从业者首选的预测模型族。但由于其离散决策边界,学习树具有挑战性。当前最优 (SOTA) 技术诉诸于 (a) 学习\textit{软}树,从而丧失对数推理时间;或 (b) 使用专为特定监督学习设置定制的方法,需要访问带标签样本和损失函数。在本工作中,通过利用过参数化和直通估计器等技术,我们提出一种统一方法,能够实现准确的端到端基于梯度的树训练,并可部署于多种设置中,如离线监督学习和带强盗反馈的在线学习。通过在标准基准上的广泛验证,我们证明我们的方法兼具两者之长,即其与专为监督设置设计的方法具有竞争力,且在某些情况下更准确;而在大多数现有树学习技术不适用的强盗设置中,我们的模型依然准确,并显著优于适用的 SOTA 方法。

关键词

引用

@article{arxiv.2102.07567,
  title  = {Learning Accurate Decision Trees with Bandit Feedback via Quantized Gradient Descent},
  author = {Ajaykrishna Karthikeyan and Naman Jain and Nagarajan Natarajan and Prateek Jain},
  journal= {arXiv preprint arXiv:2102.07567},
  year   = {2022}
}

备注

Accepted to TMLR