利用偏好学习中先验知识学习个性化自动驾驶驾驶风格
系统与控制
2025-10-20 v1 机器学习
系统与控制
摘要
自动车轨迹规划通常采用模型预测控制 (Model Predictive Control) 在移动时域上进行优化,其中代价函数对最终驾驶风格具有决定性影响。然而,寻找能够产生乘客偏好驾驶风格的合适代价函数仍是一个持续的挑战。我们采用偏好贝叶斯优化来学习代价函数,通过迭代查询乘客的偏好。由于参数空间的维度不断增加,偏好学习方法可能在有限的实验次数下难以找到合适的优化解,并暴露出乘客在探索参数空间时感到不适。我们通过纳入先验知识来解决这些挑战,将其整合到偏好贝叶斯优化框架中。该方法从真实世界的人类驾驶数据构建一个虚拟决策者,以引导参数采样。在仿真实验中,我们的方法在纳入先验知识的学习过程中实现了比现有偏好贝叶斯优化方法更快的收敛,并减少了样本不良驾驶风格的采样。
引用
@article{arxiv.2503.15407,
title = {Exploiting Prior Knowledge in Preferential Learning of Individualized Autonomous Vehicle Driving Styles},
author = {Lukas Theiner and Sebastian Hirt and Alexander Steinke and Rolf Findeisen},
journal= {arXiv preprint arXiv:2503.15407},
year = {2025}
}
备注
6 pages, 6 figures, accepted for ECC 2025