中文

经验滤波器:在未见任务或环境中利用过往经验

机器人学 2023-05-31 v1

摘要

训练自动驾驶车辆(AV)智能体的瓶颈之一是训练环境的多变性。由于在未见环境中学习最优策略通常代价高昂且需要大量数据收集,在 AV 可能遇到的每一种可能环境或任务上训练智能体在计算上变得不可行。本文引入一种零样本滤波方法,插值过往经验的学习策略以泛化至未见环境。我们使用经验核来关联环境。这些关联随后被用于由已学策略生成新任务或新环境的策略。我们在具有不同特征的 T 型交叉口自动驾驶中演示了我们的方法,其行为被建模为部分可观测马尔可夫决策过程(POMDP)。我们首先在给定顺序动作与观测数据集下,为具有未知转移函数的 POMDP 构建已学策略的紧凑表示。然后,我们滤波先前访问环境的参数化策略以生成新未见环境的策略。我们在实际 AV 和高保真模拟器上均演示了我们的方法。结果表明,我们的经验滤波器为创建前所未见任务或环境的策略提供了快速、低代价且近最优的解。此外,生成的新策略优于使用从过往环境收集的全部数据所学得的策略,表明不同环境间的关联可被利用,且不相关的环境可被滤除。

关键词

引用

@article{arxiv.2305.18633,
  title  = {Experience Filter: Using Past Experiences on Unseen Tasks or Environments},
  author = {Anil Yildiz and Esen Yel and Anthony L. Corso and Kyle H. Wray and Stefan J. Witwicki and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2305.18633},
  year   = {2023}
}

备注

Accepted at IEEE Intelligent Vehicles Symposium (IV) 2023