中文

通过 Voronoi 状态分区提炼到局部专化线性策略的可解释强化学习策略

机器学习 2025-11-18 v1 人工智能

摘要

深度强化学习是产生接近最优系统控制器的前沿方法之一。然而,深度强化学习算法训练的深度神经网络缺乏透明度,这在控制器需要满足监管要求或建立信任时会造成挑战。为缓解这一问题,可以通过知识蒸馏将所学行为转移到一个以人类可读设计为特征的模型中。通常这通过单个模型在平均意义上模拟原始模型来实现,但在更动态的情况下可能会提出挑战。关键挑战在于,这种更简单的模型应在灵活性与复杂度之间取得正确平衡,或在偏差和准确性之间取得正确平衡。我们提出了一种新颖且模型无关的方法,通过将状态空间划分为各个区域,使简化的人类可理解模型能够在各区域内运行。在本文中,我们使用 Voronoi 分区找到各区域,使得线性模型在性能上接近原始控制器。我们在网格世界环境和经典控制任务上对方法进行评估。我们观察到,所提出的蒸馏到局部专化线性模型的策略产生了可解释的策略,并且蒸馏的策略在性能上匹配甚至略优于它们从哪里蒸馏的黑箱策略。

关键词

引用

@article{arxiv.2511.13322,
  title  = {Explainable RL Policies by Distilling to Locally-Specialized Linear Policies with Voronoi State Partitioning},
  author = {Senne Deproost and Dennis Steckelmacher and Ann Nowé},
  journal= {arXiv preprint arXiv:2511.13322},
  year   = {2025}
}

备注

Accepted for BNAIC/BeNeLearn 2025