通过多步前驱模型缓解 Dyna 规划中的价值幻觉
机器学习
2026-04-07 v2 人工智能
机器学习
摘要
Dyna 式强化学习(RL)智能体利用环境模型生成的模拟经验更新价值函数,从而比无模型 RL 智能体具有更高的样本效率。然而,学习准确的环境动态模型通常很困难,即便微小误差也可能导致 Dyna 智能体失败。本文指出该失败的一个潜在原因是基于模拟状态价值的自举,并引入一种新的 Dyna 算法以避免此失败。我们讨论了基于后继或前驱模型(向前或向后模拟)以及单步或多步更新的 Dyna 算法设计空间。其中三种变体已被探索,但令人惊讶的是第四种变体尚未被研究:使用带多步更新的前驱模型。我们提出幻觉价值假说(HVH):将真实状态的价值更新朝向模拟状态的价值,会导致误导性的动作价值,从而对控制策略产生不利影响。我们讨论并评估了 Dyna 的全部四种变体,其中三种将真实状态更新朝向模拟状态——因此可能朝向幻觉价值——而我们提出的方法则不然。实验结果支持了 HVH,并表明使用带多步更新的前驱模型是开发对模型误差更鲁棒的 Dyna 算法的一个有前景的方向。
引用
@article{arxiv.2006.04363,
title = {Mitigating Value Hallucination in Dyna Planning via Multistep Predecessor Models},
author = {Farzane Aminmansour and Taher Jafferjee and Ehsan Imani and Erin Talvitie and Micheal Bowling and Martha White},
journal= {arXiv preprint arXiv:2006.04363},
year = {2026}
}
备注
Published in Journal of Artificial Intelligence (JAIR) in 2024. Updated to published version, changed title to JAIR version, added a new author that led the submission