中文

基于随机效用逆强化学习的轨迹建模

人工智能 2024-01-22 v2 机器学习 机器学习

摘要

我们从逆强化学习的视角考虑对道路网络中驾驶员轨迹进行建模的问题。车辆由布置在城市街道网络稀疏分布点上的传感器检测。作为理性智能体,驾驶员试图最大化某个外部观察者未知奖励函数。我们应用计量经济学中的随机效用概念,将未知奖励函数建模为已观测与未观测特征的函数。与当前逆强化学习方法不同,我们不假设智能体依据随机策略行动;而是假设智能体依据确定性最优策略行动,并表明数据中的随机性源于外部观察者未能完全观测到确切奖励。我们引入扩展状态的概念以应对未观测特征,并建立了驾驶员决策的马尔可夫决策过程表述。我们给出了保证解存在的理论结果,并表明最大熵逆强化学习是我们方法的一个特例。最后,我们通过来自巴西一座大城市的真实轨迹数据案例研究,展示了模型参数的贝叶斯推断。

关键词

引用

@article{arxiv.2105.12092,
  title  = {Trajectory Modeling via Random Utility Inverse Reinforcement Learning},
  author = {Anselmo R. Pitombeira-Neto and Helano P. Santos and Ticiana L. Coelho da Silva and José Antonio F. de Macedo},
  journal= {arXiv preprint arXiv:2105.12092},
  year   = {2024}
}

备注

31 pages; expanded version, with the addition of proofs not present in the first version