超越特权:将稠密奖励知识蒸馏到稀疏奖励策略中
机器人学
2025-12-30 v2
摘要
我们研究如何在不继承其与部署指标不匹配的前提下,利用基于视觉的自主驾驶中的稠密模拟器定义奖励。在真实模拟器如CARLA中,可将特权状态(如车道几何、违规行为、碰撞时间)转换为稠密奖励,以稳定和加速基于模型的强化学习,但直接在这些信号上训练的策略常常过拟合,难以在稀疏目标(如路线完成、无碰撞超车)上获得良好泛化。我们提出一种特权奖励世界模型蒸馏方法,这是一个两阶段框架:首先训练一个拥有稠密特权奖励的教师DreamerV3风格智能体,随后仅提取其潜在动态进行蒸馏,学生智能体仅使用稀疏任务奖励训练。教师与学生共享相同的观察空间(语义鸟瞰图图像);特权信息仅通过教师的奖励进入,学生不模仿教师的动作或价值估计。相反,学生的世界模型被正则化以匹配教师的潜在动态,而其策略则从稀疏成功/失败信号中零散学习。在CARLA的车道跟随和超车基准测试中,稀疏奖励学生的表现优于稠密奖励教师和稀疏从零开始的基线。在未见的车道跟随路线上,特权蒸馏相对于稠密教师提升约23%的成功率,同时保持或改善安全性。在超车任务中,学生在训练路线上保持近乎完美的性能,并在未见路线上实现最高达27倍的成功率提升,同时改善车道保持。这些结果表明,稠密奖励可被有效利用以学习更丰富的动态模型,而部署策略可严格优化于稀疏、与部署对齐的目标。
引用
@article{arxiv.2512.04279,
title = {Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies},
author = {Feeza Khan Khanzada and Jaerock Kwon},
journal= {arXiv preprint arXiv:2512.04279},
year = {2025}
}