用于提取黑箱强化学习策略的层次化支持向量状态划分
机器学习
2026-05-18 v2 人机交互
摘要
我们提出状态向量空间划分 (SVSP),一种新颖的方法,用于使用一组人类可解释子策略来模拟黑箱强化学习策略。通过对蒸馏数据集中的状态动作对使用线性支持向量机划分,SVSP 构建了原始策略的紧凑且结构化的表示。我们的方法在平均回报上比以前的以评论驱动的状态划分方法(如 Voronoi 状态划分 (VSP))提高了 +7.4%,相较于原始 TD3 策略提高了 +2.8%,同时在所需子策略数量上较 VSP 减少了 82.1%。我们的结果为更灵活的蒸馏形式开辟了道路,使得决策边界和代理模型都可以在原始黑箱行为的容差范围内被选择。
引用
@article{arxiv.2605.04254,
title = {Hierarchical Support Vector State Partitioning for Distilling Black Box Reinforcement Learning Policies},
author = {Senne Deproost and Mehrdad Asadi and Ann Nowé},
journal= {arXiv preprint arXiv:2605.04254},
year = {2026}
}
备注
Accepted for poster presentation at HHAI 2026