动态博弈中基于部分观测的玩家目标在线与离线学习
机器人学
2023-05-16 v2
摘要
部署到真实世界的机器人必须能够与其环境中的其他智能体交互。动态博弈论为建模智能体具有个体目标且交互随时间演化的场景提供了强大的数学框架。然而,此类技术的一个关键局限是它们需要所有玩家目标的先验知识。在这项工作中,我们通过提出一种新颖的方法来解决此问题,该方法用于从受噪声干扰的部分状态观测中学习连续动态博弈中的玩家目标。我们的方法通过纳什均衡约束,将每个玩家未知成本参数的估计与未观测状态和输入的推断耦合起来,从而学习目标。通过将过去的状态估计与未来的状态预测相结合,我们的方法适用于滚动时域方式下的同步在线学习和预测。我们在几个模拟交通场景中演示了我们的方法,在这些场景中,我们恢复了玩家对期望行驶速度和避碰行为等的偏好。结果表明,我们的方法能够从受噪声干扰的数据中可靠地估计出与真实目标紧密匹配的博弈论模型,其性能始终优于最先进的方法。
引用
@article{arxiv.2302.01999,
title = {Online and Offline Learning of Player Objectives from Partial Observations in Dynamic Games},
author = {Lasse Peters and Vicenç Rubies-Royo and Claire J. Tomlin and Laura Ferranti and Javier Alonso-Mora and Cyrill Stachniss and David Fridovich-Keil},
journal= {arXiv preprint arXiv:2302.01999},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2106.03611