中文

基于社会对抗交通流的驾驶策略零样本迁移学习

机器人学 2023-04-26 v1

摘要

在密集交通流中行驶时,获取可迁移至未知环境的驾驶策略具有挑战性。交通流的设计至关重要,而以往研究无法平衡交互性与安全性评判。为解决这个问题,我们提出了一种社会对抗交通流。我们采用情境部分可观测随机博弈(Contextual Partially-Observable Stochastic Game)对交通流建模,并将社会价值取向(SVO)指定为上下文。随后我们采用两阶段框架。在第一阶段,社会感知交通流中的每个智能体由分层策略驱动,其中上层策略传达所有智能体的真实SVO,下层策略将其作为输入。在第二阶段,社会对抗交通流中的每个智能体由该分层策略驱动,其中上层传达错误的SVO,由第一阶段训练的下层策略接收。驾驶策略通过与上层策略的零和博弈公式进行对抗训练,从而产生具有增强的向未知交通流零样本迁移能力的策略。交叉验证上的综合实验验证了我们的方法优越的零样本迁移性能。

关键词

引用

@article{arxiv.2304.12821,
  title  = {Zero-shot Transfer Learning of Driving Policy via Socially Adversarial Traffic Flow},
  author = {Dongkun Zhang and Jintao Xue and Yuxiang Cui and Yunkai Wang and Eryun Liu and Wei Jing and Junbo Chen and Rong Xiong and Yue Wang},
  journal= {arXiv preprint arXiv:2304.12821},
  year   = {2023}
}