中文

面向风险敏感导航的风险条件化分布软演员-评论家方法

机器学习 2021-04-12 v2 人工智能 机器人学

摘要

基于深度强化学习(RL)的现代导航算法展现出令人瞩目的效率与鲁棒性。然而,大多数深度RL算法以风险中性方式运行,未特别尝试将用户与相对罕见但严重的后果隔离,即便此类隔离可能仅造成微小的性能损失。此外,尽管其运行环境极为复杂,这类算法通常未规定在训练所用模型存在不准确时如何保障安全,仅在训练时加入碰撞代价与一些域随机化。本文提出一种新颖的分布RL算法,不仅能学习感知不确定性的策略,还可无需昂贵的微调或重训练即可改变其风险度量。我们的方法在部分可观测导航任务中展现出优于基线的性能与安全性。我们还证明了使用本方法训练的智能体可在运行时将其策略适配至广泛的风险度量。

关键词

引用

@article{arxiv.2104.03111,
  title  = {Risk-Conditioned Distributional Soft Actor-Critic for Risk-Sensitive Navigation},
  author = {Jinyoung Choi and Christopher R. Dance and Jung-eun Kim and Seulbin Hwang and Kyung-sik Park},
  journal= {arXiv preprint arXiv:2104.03111},
  year   = {2021}
}

备注

ICRA 2021. For associated videos, see https://europe.naverlabs.com/