IBMDP中决策树策略学习的行动者-评论家算法局限
机器学习
2024-01-23 v3 人工智能
摘要
AI模型的可解释性允许用户进行安全检查,从而建立对此类AI的信任。特别地,决策树(DTs)提供了对所学模型的全局审视,并透明地揭示输入的哪些特征对决策至关重要。然而,若DT过大则会妨碍可解释性。为学习紧凑的树,近期提出了一种强化学习(RL)框架,使用深度RL探索DT空间。该框架将一个决策问题(例如监督分类任务)扩充以额外动作,这些动作收集原本隐藏输入的特征信息。通过适当惩罚这些动作,智能体学习在DT的大小与性能间最优权衡。实践中,需要学习部分可观测马尔可夫决策过程(MDP)的反应式策略,这仍是一个开放问题。我们在本文中表明,深度RL即便在此类的简单玩具任务上也会失败。然而,当底层决策问题是监督分类任务时,我们表明寻找最优树可化为完全可观测马尔可夫决策问题并高效求解,从而产生超越经典贪心最大化算法的新一类DT学习算法。
引用
@article{arxiv.2309.13365,
title = {Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs},
author = {Hector Kohler and Riad Akrour and Philippe Preux},
journal= {arXiv preprint arXiv:2309.13365},
year = {2024}
}
备注
To be included in an other submission. arXiv admin note: text overlap with arXiv:2304.05839