中文

大型语言模型增强型强化学习用于通用巴士保持控制策略

人工智能 2025-04-15 v2 机器学习

摘要

巴士保持控制是维持巴士系统稳定性和提高运营效率的广泛采用策略。传统的基于模型的方法常因巴士状态预测和乘客需求估计的准确率低而面临挑战。相比之下,强化学习(RL)作为一种数据驱动的方法,在制定巴士保持策略方面显示出巨大的潜力。RL 通过确定最优控制策略来最大化累积奖励,这反映了整体控制目标。然而,将现实任务中稀疏且延迟的控制目标转化为稠密且实时的 RL 奖励具有挑战性,通常需要大量的人工试错。在此基础上,本研究引入了一种自动奖励生成范式,利用大型语言模型(LLM)的 in-context learning 和推理能力。该新范式称为 LLM-enhanced RL,包括几个 LLM-based 模块:奖励初始化器、奖励修改器、绩效分析器和奖励精炼器。这些模块协作,根据训练和测试结果的反馈初始化和迭代改进特定 RL 任务的奖励函数。筛选无效的 LLM 生成的奖励函数,以确保 RL 代理性能在迭代中的稳定演进。为评估所提 LLM-enhanced RL 范式的可行性,将其应用于各种巴士保持控制场景,这些场景在巴士线路、站点和乘客需求方面各不相同。结果表明,所提范式在性能、泛化能力和鲁棒性方面优于 vanilla RL 策略、LLM-based 控制器、基于物理的反馈控制器和基于优化的控制器。这一研究为在各种智能出行应用中利用 LLM 的潜力指明了方向。

关键词

引用

@article{arxiv.2410.10212,
  title  = {Large Language Model-Enhanced Reinforcement Learning for Generic Bus Holding Control Strategies},
  author = {Jiajie Yu and Yuhong Wang and Wei Ma},
  journal= {arXiv preprint arXiv:2410.10212},
  year   = {2025}
}

备注

51 pages, 19 figures