中文

Prism:通过强化学习中的可解释策略映射实现策略复用

机器学习 2026-04-06 v1 人工智能

摘要

我们提出了 PRISM(通过可解释策略映射实现策略复用),一个将强化学习智能体的决策建立在离散的、因果验证的概念之上,并将这些概念用作在不同算法训练的智能体之间零样本迁移接口的框架。PRISM 通过 K-means 将每个智能体的编码器特征聚类为 K 个概念。因果干预确立了这些概念直接驱动——而不仅仅是相关于——智能体行为:覆盖概念分配在 69.4% 的干预中改变了所选动作(p = 8.6 × 10⁻⁸⁶,2500 次干预)。概念重要性和使用频率是分离的:最常用的概念(C47,33.0% 频率)在消融时仅导致 9.4% 的胜率下降,而消融 C16(15.4% 频率)使胜率从 100% 降至 51.8%。由于概念因果地编码策略,通过最优二分匹配对齐它们可以零样本迁移策略知识。在 Go 7×7 上,使用三个独立训练的智能体,概念迁移在两次成功迁移对(10 个种子)上分别实现了 69.5%±3.2% 和 76.4%±3.4% 的胜率,对抗标准引擎,而随机智能体为 3.5%,无对齐为 9.2%。当源策略较强时迁移成功;几何对齐质量预测不了任何东西(R² ≈ 0)。该框架适用于战略状态自然离散的领域:在 Atari Breakout 上使用相同流水线产生随机智能体性能的瓶颈策略,确认 Go 结果反映了该领域的结构特性。

关键词

引用

@article{arxiv.2604.02353,
  title  = {Prism: Policy Reuse via Interpretable Strategy Mapping in Reinforcement Learning},
  author = {Thomas Pravetz},
  journal= {arXiv preprint arXiv:2604.02353},
  year   = {2026}
}

备注

13 pages, 3 figures, 5 tables