中文

xSRL:安全感知的可解释强化学习 —— 将安全性作为可解释性的产物

人工智能 2024-12-30 v1 人机交互 机器学习 多智能体系统

摘要

强化学习 (RL) 在模拟环境中展现出巨大的潜力,例如游戏中,失败的后果微乎其微。然而,将 RL 智能体部署到真实系统中,如自动驾驶车辆、机器人、无人机和医疗设备时,需要更高的安全性和透明度,尤其是在面对对抗性威胁时。已develop出安全 RL 算法,以优化任务性能和安全约束。然而,错误不可避免,发生时,RL 智能体必须能够向人类操作员解释其行为。这对于有效部署 RL 系统至关重要。可解释性通过提供清晰可操作的见解来解释智能体决策过程,确保安全关键决策得到充分理解。虽然机器学习 (ML) 在可解释性和可视化方面取得了显著进展,但 RL 的可解释性方法仍有限。当前工具未能解决 RL 的动态、序列化特性,以及其需要在时间段平衡任务性能与安全约束。传统 ML 方法(如显著图)被重新用于安全关键 RL 应用,错误可能导致严重后果。为填补这一差距,我们提出 xSRL 框架,将本地和全局解释集成在一起,提供对 RL 智能体行为的全面理解。xSRL 还允许开发人员通过对抗攻击识别策略漏洞,提供调试和修补智能体的工具,而无需重新训练。我们的实验和用户研究表明,xSRL 在提高 RL 系统安全性方面有效,使其更可靠、更值得信赖,可用于实际部署。代码可在 https://github.com/risal-shefin/xSRL 查看。

关键词

引用

@article{arxiv.2412.19311,
  title  = {xSRL: Safety-Aware Explainable Reinforcement Learning -- Safety as a Product of Explainability},
  author = {Risal Shahriar Shefin and Md Asifur Rahman and Thai Le and Sarra Alqahtani},
  journal= {arXiv preprint arXiv:2412.19311},
  year   = {2024}
}

备注

Accepted to 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025)