合成数据在强化学习中的法医学分析:诊断和解决基于模型的策略优化中的算法故障
机器学习
2025-10-06 v2
摘要
合成数据是数据高效 Dyna 式模型基强化学习中的核心,但也可能导致性能下降。我们研究了 Model-Based Policy Optimization(MBPO)中的这种失效现象,该方法使用模型生成的合成状态转换进行 actor-critic 更新。尽管 MBPO 在 OpenAI Gym 上报告显示出显著的样本效率提升,但近期研究表明它在 DeepMind Control Suite(DMC)中常常不如其非 Dyna 基线 Soft Actor-Critic(SAC),尽管两者都涉及 MuJoCo 基于机体感知的连续控制。我们确定了这种崩溃的两个相互关联的原因:dynamics 和 reward 目标之间的尺度不匹配抑制了奖励学习并导致 critic 估计不足,以及残余的下一个状态预测导致模型方差膨胀并产生不可靠的合成转换。我们引入了 Fixing That Free Lunch(FTFL),这是一种最小性修复,结合独立的目标归一化和直接的下一个状态预测。FTFL 在之前七个失败的 DMC 任务中中 outperform SAC,而又保留了 MBPO 在 Gym 上的强大性能。我们进一步表明,包括不确定性感知变体在内的 MBPO 系列算法(这些变体根据模型不确定性过滤、惩罚或拒绝合成转换)仍然继承了这些失效,除非对其共享的学习模型 backbone 应用 FTFL。更广泛地说,我们的结果表明,受限于基准的评估会将特定环境的假设编码到算法设计中,激励将 MDP 结构映射到算法失效模式的分类。
引用
@article{arxiv.2510.01456,
title = {SCOPED: Score-Curvature Out-of-distribution Proximity Evaluator for Diffusion},
author = {Brett Barkley and Preston Culbertson and David Fridovich-Keil},
journal= {arXiv preprint arXiv:2510.01456},
year = {2025}
}