通过量化梯度下降在强盗反馈下学习精确决策树
机器学习
2022-10-03 v3
摘要
决策树提供了一类丰富且高度非线性但高效的模型,因此仍是各领域从业者首选的预测模型族。但由于其离散决策边界,学习树具有挑战性。当前最优 (SOTA) 技术诉诸于 (a) 学习\textit{软}树,从而丧失对数推理时间;或 (b) 使用专为特定监督学习设置定制的方法,需要访问带标签样本和损失函数。在本工作中,通过利用过参数化和直通估计器等技术,我们提出一种统一方法,能够实现准确的端到端基于梯度的树训练,并可部署于多种设置中,如离线监督学习和带强盗反馈的在线学习。通过在标准基准上的广泛验证,我们证明我们的方法兼具两者之长,即其与专为监督设置设计的方法具有竞争力,且在某些情况下更准确;而在大多数现有树学习技术不适用的强盗设置中,我们的模型依然准确,并显著优于适用的 SOTA 方法。
引用
@article{arxiv.2102.07567,
title = {Learning Accurate Decision Trees with Bandit Feedback via Quantized Gradient Descent},
author = {Ajaykrishna Karthikeyan and Naman Jain and Nagarajan Natarajan and Prateek Jain},
journal= {arXiv preprint arXiv:2102.07567},
year = {2022}
}
备注
Accepted to TMLR