面向Gran Turismo的自动化奖励设计
人工智能
2025-11-05 v1
摘要
在设计强化学习(RL)代理时,设计者通过定义奖励函数来传达所需的代理行为——对代理动作给予数值反馈作为奖励或惩罚。然而,将所需行为映射到奖励函数是一个困难的过程,尤其是在复杂环境中,如自动驾驶赛车。本文演示了如何利用当前基础模型有效地在奖励函数空间中搜索,以为Gran Turismo 7赛车游戏中给定仅文本指令的RL代理生产理想的代理。通过结合LLM-based奖励生成、VLM偏好-based评估和人类反馈,我们展示了该系统可用于生产与GT Sophy(一个冠军级RL赛车代理)竞争的赛车代理,以及生成新行为,为实际的自动化奖励设计在现实应用中铺路。
引用
@article{arxiv.2511.02094,
title = {Automated Reward Design for Gran Turismo},
author = {Michel Ma and Takuma Seno and Kaushik Subramanian and Peter R. Wurman and Peter Stone and Craig Sherstan},
journal= {arXiv preprint arXiv:2511.02094},
year = {2025}
}