当 LLM 奖励设计失败:基于诊断的稀疏结构化强化学习中的迭代细化
机器学习
2026-05-29 v1 信息检索
摘要
对于稀疏、结构化的强化学习任务及其语义奖励函数接口,LLM 生成的奖励塑造更应被视为调试而非一次性生成。我们使用 PPO 训练的智能体,以 MiniGrid 作为核心评估工具,MuJoCo 作为边界压力测试。我们的审计发现两种主要的一次性失败模式——奖励过载和语义/API 误理解——以及一种较少见的弱塑形情况。我们提出基于诊断的迭代细化方法,训练诊断与失败模式分类学引导有针对性的奖励函数修订。细化后,DoorKey-8x8 从 2.3% 提升至 97.6%,KeyCorridor 从 31.2% 提升至 86.7%,但存在较大的随机种子间方差。控制组实验表明,这些提升并非源于重试或额外训练:仅基于指标的重新提示会导致显著下降,而静态词汇控制组恢复了大部分差距(分别为 87.6% 与 70.7%),表明分类学提示词是主要机制,而动态标签仅提供部分孤立的增量证据。预算匹配的比较与最佳三项比较分别将细化与选择及训练时效应分离。组件移除测试、灵敏度分析以及针对作者标签的审计提供了关于调试解释的收敛证据,同时揭示了校准的局限性。连续控制结果显示边界条件:基于成功的诊断在稠密奖励 locomotion 任务中可能产生误报,而基于回报趋势的反馈则移除了一个假阳性机制但未带来实质性提升。低调用协议是与基于群体的奖励搜索成本对比,而非基准测试比较。在四个交叉方差设计的环境中,点估计表明当 LLM 奖励函数方差占主导时可能获得更大收益,但自助置信区间较宽。该方法局限于 PPO 下具有可靠接口的稀疏结构化任务;诸如 event_text 等领域可能有帮助、甚至适得其反。
引用
@article{arxiv.2605.28918,
title = {When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL},
author = {Youting Wang and Yuan Tang and Bowen Liu and Xuan Liu and Dingyan Shang},
journal= {arXiv preprint arXiv:2605.28918},
year = {2026}
}