面向机器人与连续控制的 Interpretable 强化学习
机器人学
2023-11-17 v1
摘要
机器学习中的可解释性对于在受法律监管和安全关键的领域中安全部署学习到的策略至关重要。尽管基于梯度的强化学习方法在为机器人与自动驾驶等连续控制问题学习策略方面取得了巨大成功,但缺乏可解释性是采用的根本障碍。我们提出可解释连续控制树(ICCTs),一种基于树的模型,可通过现代基于梯度的强化学习方法进行优化,以产生高性能、可解释的策略。我们方法的关键在于一种允许在稀疏类决策树表示中直接优化的过程。我们在六个领域中将 ICCTs 与基线进行验证,表明 ICCTs 能够学习到在自动驾驶场景中持平或优于基线达 33% 的策略,同时相较于深度学习基线实现了 300倍–600倍 的参数数量缩减。我们证明 ICCTs 可作为通用函数逼近器,并解析地展示 ICCTs 可在线性时间内被验证。此外,我们将 ICCTs 部署于两个基于美国州际 Highway-94 与 280 的真实驾驶领域。最后,我们通过终端用户验证 ICCT 的效用,发现相较于神经网络,ICCTs 被评为更易模拟、更快验证且更具可解释性。
引用
@article{arxiv.2311.10041,
title = {Interpretable Reinforcement Learning for Robotics and Continuous Control},
author = {Rohan Paleja and Letian Chen and Yaru Niu and Andrew Silva and Zhaoxin Li and Songan Zhang and Chace Ritchie and Sugju Choi and Kimberlee Chestnut Chang and Hongtei Eric Tseng and Yan Wang and Subramanya Nageshrao and Matthew Gombolay},
journal= {arXiv preprint arXiv:2311.10041},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2202.02352