中文

基于上下文相关奖励的深度逆强化学习路径选择建模方法

机器学习 2023-03-01 v2 人工智能

摘要

路径选择建模是交通规划与需求预测中的基本任务。经典方法通常采用具有线性效用函数和高层次路径特征的离散选择模型(DCM)框架。尽管近期若干研究已开始探索深度学习在路径选择建模中的适用性,但它们局限于具有相对简单模型架构且依赖预定义选择集的基于路径的模型。现有的基于链路的模型能够捕捉行程中链路选择的动态特性而无需生成选择集,但仍假设线性关系与链路可加特征。为解决这些问题,本研究提出一种用于基于链路的路径选择建模的通用深度逆强化学习(IRL)框架,其能够融合多样特征(状态、动作与行程上下文)并捕捉复杂关系。具体而言,我们将对抗式 IRL 模型适配于路径选择问题,以在无值迭代的情况下高效估计上下文相关奖励函数。基于中国上海出租车 GPS 数据的实验结果验证了所提模型相对于传统 DCM 及其他模仿学习基线具有更优的预测性能,即便对于训练数据中未出现的目的地也是如此。进一步分析表明,该模型具有竞争力的计算效率和合理的可解释性。所提方法为路径选择模型的未来发展提供了新方向,其具有通用性并可适配于不同模式和网络下的其他路径选择问题。

关键词

引用

@article{arxiv.2206.10598,
  title  = {A deep inverse reinforcement learning approach to route choice modeling with context-dependent rewards},
  author = {Zhan Zhao and Yuebing Liang},
  journal= {arXiv preprint arXiv:2206.10598},
  year   = {2023}
}