风险条件化神经运动规划
机器学习
2021-08-05 v1 人工智能
机器人学
摘要
风险有界运动规划对于安全关键任务而言是一个重要却困难的问题。尽管现有的数学规划方法在约束马尔可夫决策过程的背景下提供理论保证,但它们要么在求解较大问题时缺乏可扩展性,要么产生保守的计划。深度强化学习的最新进展通过学习策略网络作为函数逼近器来改善可扩展性。在本文中,我们提出一种软 actor-critic 模型的扩展,通过风险评论家估计计划的执行风险,并通过在策略网络的损失函数中添加额外的风险项来高效地生成风险有界策略。我们以精确的形式定义执行风险,而非通过在每个时间步将即时风险求和来近似,后者会导致保守的计划。我们提出的模型以连续的风险界谱为条件,允许用户即时调整智能体的风险厌恶水平。通过一组实验,我们展示了与最先进的数学规划基线相比,我们的模型在计算时间和计划质量方面的优势,并验证了其在更复杂场景(包括非线性动力学和更大状态空间)中的性能。
引用
@article{arxiv.2108.01851,
title = {Risk Conditioned Neural Motion Planning},
author = {Xin Huang and Meng Feng and Ashkan Jasour and Guy Rosman and Brian Williams},
journal= {arXiv preprint arXiv:2108.01851},
year = {2021}
}
备注
Accepted at IROS'21. Author version with 7 pages, 5 figures, 2 tables, and 1 algorithm