通过基于人类反馈的强化学习学习个性化驾驶风格
机器人学
2025-09-29 v2 计算机视觉与模式识别
机器学习
摘要
在动态环境中生成符合人类习惯且具有自适应性的轨迹是自动驾驶的关键任务。虽然生成模型在合成可行轨迹方面显示出前景,但往往无法捕捉个性化驾驶风格中细微的可变性 due to 数据偏差和分布迁移。为此,我们引入TrajHF,一个面向生成轨迹模型的人类反馈驱动的微调框架,旨在将运动规划与多样化驾驶风格保持一致。TrajHF集成了多条件去噪器和基于人类反馈的强化学习,以超越传统模仿学习对多模态轨迹生成进行细化,实现更好地与人类驾驶偏好保持一致,同时保持安全和可行性约束。TrajHF在NavSim基准测试中达到的性能与最新成果相当,设定了个人化和可适应轨迹生成的新范式。
引用
@article{arxiv.2503.10434,
title = {Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback},
author = {Derun Li and Changye Li and Yue Wang and Jianwei Ren and Xin Wen and Pengxiang Li and Leimeng Xu and Kun Zhan and Peng Jia and Xianpeng Lang and Ningyi Xu and Hang Zhao},
journal= {arXiv preprint arXiv:2503.10434},
year = {2025}
}
备注
20 pages, 6 figures