面向随机驾驶环境的具有不确定性感知能力的决策Transformer
机器学习
2024-10-08 v3 人工智能
摘要
离线强化学习(RL)能够在无需主动交互的情况下进行策略学习,因此在自动驾驶任务中尤其具有吸引力。Transformer近期的成功启发了将离线RL视为序列建模的方法,然而该方法在随机环境中因错误假设相同动作总能一致地达成同一目标而失效。本文提出一种具有不确定性感知能力的决策Transformer(UNREST),用于在随机驾驶环境中进行规划,且不引入额外的转移模型或复杂生成模型。具体而言,UNREST通过转移与回报之间的条件互信息来估计不确定性。我们发现驾驶环境具有“不确定性累积”与“时间局部性”特性,据此将决策Transformer中的全局回报替换为受环境较小影响的截断回报,以从动作的实际结果而非环境转移中学习。我们还在推理时动态评估不确定性以实现谨慎规划。大量实验表明,UNREST在各种驾驶场景中性能优越,且我们的不确定性估计策略行之有效。
引用
@article{arxiv.2309.16397,
title = {Uncertainty-Aware Decision Transformer for Stochastic Driving Environments},
author = {Zenan Li and Fan Nie and Qiao Sun and Fang Da and Hang Zhao},
journal= {arXiv preprint arXiv:2309.16397},
year = {2024}
}