中文

基于评论家驱动的Voronoi量化将深度强化学习策略蒸馏为可解释模型

机器学习 2026-05-15 v1 人工智能

摘要

尽管已有许多使用蒸馏解释深度强化学习策略的成功尝试,但平衡性能与可解释性之间的权衡并选择合适的代理模型仍然困难。此外,传统蒸馏仅最小化原始策略与代理策略行为之间的距离,而忽略了动作价值等其他强化学习特定组件。为解决此问题,我们提出了一种与模型无关的新方法,称为评论家驱动的Voronoi状态划分,该方法将黑盒控制策略划分为多个区域,在每个区域内可以使用梯度下降优化一类简单模型。通过利用原始策略的评论家价值网络,我们在价值不足的区域迭代引入新子策略,以此作为策略复杂度的衡量标准。该划分作为一个Voronoi量化器,使用最近邻查找将线性函数分配给状态空间中的每个点,从而生成类似单元的图表。我们在几个著名的基准上验证了我们的方法,并证明这种蒸馏方法能够使用合理规模的线性函数集合逼近原始策略。

关键词

引用

@article{arxiv.2605.14897,
  title  = {Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models},
  author = {Senne Deproost and Denis Steckelmacher and Ann Nowé},
  journal= {arXiv preprint arXiv:2605.14897},
  year   = {2026}
}

备注

Accepted for presentation at EXTRAAMAS 2026