面向车辆控制的奖励无关强化学习框架
机器学习
2025-04-21 v2
摘要
强化学习在车辆控制中发挥着关键作用,通过设计或学习合适的奖励信号来指导代理人学习最优控制策略。然而,在车辆控制应用中,奖励信号通常需要在考虑多个隐含因素的前提下手动设计,这容易引入人类偏见。虽然模仿学习方法不依赖显式奖励信号,但需要高质量的专家动作,而这往往难以获取。为此,我们提出了奖励无关强化学习框架(RFRLF)。该框架通过目标状态预测网络(TSPN)和奖励无关状态导向策略网络(RFSGPN)直接学习代理人行为的目标状态,从而避免对手动设计奖励信号的依赖。具体而言,策略网络通过最小化预测状态与专家状态之间的差异来学习。实验结果表明,所提出的RFRLF在控制车辆驾驶方面有效,显示出在提高学习效率和适应奖励无关环境方面的优势。
引用
@article{arxiv.2502.15262,
title = {Towards a Reward-Free Reinforcement Learning Framework for Vehicle Control},
author = {Jielong Yang and Daoyuan Huang},
journal= {arXiv preprint arXiv:2502.15262},
year = {2025}
}