中文

对比稀疏自编码器用于解释国际象棋智能体的规划

人工智能 2024-06-12 v1

摘要

人工智能使国际象棋系统达到了超人类水平,但这些系统严重依赖黑箱算法。这在确保对最终用户的透明度方面是不可持续的,特别是当这些系统负责敏感决策时。最近的可解释性工作表明,深度神经网络(DNNs)的内部表示是可理解的,并且包含人类可理解的概念。然而,这些方法很少被情境化,并且通常基于单个隐藏状态,这使得它们无法解释多步推理,例如规划。为此,我们提出了对比稀疏自编码器(CSAE),一种用于研究成对游戏轨迹的新框架。使用CSAE,我们能够提取和解释对国际象棋智能体规划有意义的概念。我们主要关注CSAE特征的定性分析,然后提出自动特征分类。此外,为了评估我们训练的CSAE的质量,我们设计了合理性检查以消除结果中的虚假相关。

关键词

引用

@article{arxiv.2406.04028,
  title  = {Contrastive Sparse Autoencoders for Interpreting Planning of Chess-Playing Agents},
  author = {Yoann Poupart},
  journal= {arXiv preprint arXiv:2406.04028},
  year   = {2024}
}

备注

Worskhop on Interpretable Policies in Reinforcement Learning @ RLC-2024, 18 pages and 15 figures