目标条件强化学习为何有效:与双重控制的关系
机器学习
2026-05-15 v2 人工智能
摘要
目标条件强化学习(RL)关注训练智能体以最大化到达目标状态概率的问题。本文基于最优控制对目标条件设置进行了分析。具体而言,我们推导了更经典的(通常为二次型)目标与目标条件奖励之间的最优性差距,阐明了目标条件强化学习成功的原因以及经典「密集」奖励为何可能失效。随后我们考虑部分可观测马尔可夫决策设置,并将状态估计与概率奖励联系起来,使目标条件奖励适用于双重控制问题。通过 RL 和预测控制技术,在非线性和不确定环境中验证了目标条件策略的优势。
引用
@article{arxiv.2512.06471,
title = {Why Goal-Conditioned Reinforcement Learning Works: Relation to Dual Control},
author = {Nathan P. Lawrence and Ali Mesbah},
journal= {arXiv preprint arXiv:2512.06471},
year = {2026}
}
备注
IFAC world congress postprint