从含噪部分状态观测推断连续动态博弈中的目标
机器人学
2021-08-10 v3 多智能体系统
摘要
机器人与自主系统必须彼此交互并与其环境交互,以为用户提供高质量服务。动态博弈论为建模涉及多个具有不同目标的智能体随时间交互的场景提供了一个具表现力的理论框架。构建动态博弈时的一个核心挑战是为每个智能体设计能够捕捉期望行为的目标。在本文中,我们提出一种基于观测交互推断多个智能体参数化目标模型的方法。我们的逆博弈求解器通过纳什均衡约束将玩家目标与连续状态估计耦合,联合优化二者。因此,我们的方法能够直接最大化观测似然,而非其他非概率代理准则。我们的方法不需要对博弈状态或玩家策略的完整观测来识别玩家目标,而是从含噪的部分状态观测中稳健地恢复该信息。作为估计玩家目标的一个副产品,我们的方法计算出对应于这些目标的纳什均衡轨迹。因此,它适用于下游轨迹预测任务。我们在若干模拟交通场景中演示了我们的方法。结果表明,它能从短序列的含噪部分状态观测中可靠估计玩家目标。此外,利用估计的目标,我们的方法对每个玩家的轨迹做出了准确预测。
引用
@article{arxiv.2106.03611,
title = {Inferring Objectives in Continuous Dynamic Games from Noise-Corrupted Partial State Observations},
author = {Lasse Peters and David Fridovich-Keil and Vicenç Rubies-Royo and Claire J. Tomlin and Cyrill Stachniss},
journal= {arXiv preprint arXiv:2106.03611},
year = {2021}
}
备注
Submitted to RSS2021