安全驗證與可解釋深型強化學習政策的共啟動圖分析
人工智能
2025-01-07 v1 机器学习
摘要
深型強化學習(RL)政策可能顯示不安全行為且難以解釋。為解決這些挑戰,我們將 RL 政策檢查——用於確定 RL 政策是否呈現不安全行為的技術——與共啟動圖分析——一種透過分析神經網絡內部工作中神經元激活模式來映射的方法結合,用以獲取對安全 RL 政策順序決策的洞見。此組合允許我們解釋 RL 政策內部工作以進行安全決策。我們在各種實驗中展示了其應用性。
引用
@article{arxiv.2501.03142,
title = {Co-Activation Graph Analysis of Safety-Verified and Explainable Deep Reinforcement Learning Policies},
author = {Dennis Gross and Helge Spieker},
journal= {arXiv preprint arXiv:2501.03142},
year = {2025}
}