通过语义聚类增强深度强化学习的可解释性
人工智能
2025-10-27 v5
摘要
在本文中,我们探索了深度强化学习(DRL)的语义聚类特性,以提高其可解释性并加深对其内部语义组织的理解。在此背景下,语义聚类指的是神经网络基于输入在特征空间中的语义相似性对其进行分组的能力。我们提出了一种DRL架构,该架构包含一个新颖的语义聚类模块,该模块将特征降维与在线聚类相结合。该模块无缝集成到DRL训练流程中,解决了t-SNE的不稳定性问题,并消除了先前语义分析方法中固有的大量手动标注需求。我们通过实验验证了所提模块的有效性,并展示了其揭示DRL内部语义聚类特性的能力。此外,我们引入了基于这些特性的新分析方法,以提供对策略层次结构和特征空间内语义组织的洞察。我们的代码可在https://github.com/ualiangzhang/semantic_rl获取。
引用
@article{arxiv.2409.17411,
title = {Enhancing Interpretability in Deep Reinforcement Learning through Semantic Clustering},
author = {Liang Zhang and Justin Lieffers and Adarsh Pyarelal},
journal= {arXiv preprint arXiv:2409.17411},
year = {2025}
}
备注
NeurIPS 2025 Main Conference