中文

基于课程引导的分组相对策略优化的自动驾驶鲁棒目标检测

计算机视觉与模式识别 2025-10-08 v2

摘要

多模态大语言模型(MLLMs)在视觉-语言推理方面表现出色,但在需要精确定位和鲁棒性的结构化感知任务中往往力不从心。我们提出了一种强化学习框架,该框架通过基于课程的数据调度和难度感知过滤来增强分组相对策略优化(GRPO)。该方法在稀疏、有噪声的奖励下稳定了优化过程,并能够逐步适应复杂样本。在自动驾驶基准上的评估表明,检测精度和鲁棒性均有显著提升。消融研究证实了奖励设计、KL 正则化和课程节奏对于收敛稳定性和泛化能力的重要性。我们的发现突显了具有结构化数据课程的强化驱动优化,是通向鲁棒且可解释的多模态检测的一条可扩展路径。

关键词

引用

@article{arxiv.2509.22688,
  title  = {Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization},
  author = {Xu Jia},
  journal= {arXiv preprint arXiv:2509.22688},
  year   = {2025}
}