多智能体自动驾驶系统中基于两阶段的社会偏好识别
机器人学
2023-10-06 v1
摘要
多智能体强化学习(MARL)已成为在复杂密集场景中构建多智能体自动驾驶系统(MADS)的一种有前景的方案。但多数方法假设智能体自私行动,导致冲突行为。一些现有工作引入社会价值取向(SVO)概念以促进协调,但缺乏对其他智能体SVO的认知,导致保守机动。本文旨在通过使智能体能理解其他智能体的SVO来解决上述问题。为此,我们提出一种两阶段系统框架。首先,我们允许智能体共享其真实SVO来训练策略,以建立协调的交通流。其次,我们开发了一个识别网络来估计智能体的SVO,并将其与第一阶段训练的策略集成。实验表明,与两种最先进的MARL算法相比,我们所开发的方法显著提升了MADS中驾驶策略的性能。
引用
@article{arxiv.2310.03303,
title = {A Two-stage Based Social Preference Recognition in Multi-Agent Autonomous Driving System},
author = {Jintao Xue and Dongkun Zhang and Rong Xiong and Yue Wang and Eryun Liu},
journal= {arXiv preprint arXiv:2310.03303},
year = {2023}
}