中文

面向车辆控制的奖励无关强化学习框架

机器学习 2025-04-21 v2

摘要

强化学习在车辆控制中发挥着关键作用,通过设计或学习合适的奖励信号来指导代理人学习最优控制策略。然而,在车辆控制应用中,奖励信号通常需要在考虑多个隐含因素的前提下手动设计,这容易引入人类偏见。虽然模仿学习方法不依赖显式奖励信号,但需要高质量的专家动作,而这往往难以获取。为此,我们提出了奖励无关强化学习框架(RFRLF)。该框架通过目标状态预测网络(TSPN)和奖励无关状态导向策略网络(RFSGPN)直接学习代理人行为的目标状态,从而避免对手动设计奖励信号的依赖。具体而言,策略网络通过最小化预测状态与专家状态之间的差异来学习。实验结果表明,所提出的RFRLF在控制车辆驾驶方面有效,显示出在提高学习效率和适应奖励无关环境方面的优势。

关键词

引用

@article{arxiv.2502.15262,
  title  = {Towards a Reward-Free Reinforcement Learning Framework for Vehicle Control},
  author = {Jielong Yang and Daoyuan Huang},
  journal= {arXiv preprint arXiv:2502.15262},
  year   = {2025}
}