观测遇见动作:学习控制充分表示以实现稳健的策略泛化
机器学习
2025-07-28 v1
摘要
捕获潜在变化(“上下文”)是将强化学习 (RL) 智能体部署到其训练环境之外的关键。我们将基于上下文的 RL 重构为一个双重推理-控制问题,并形式化地刻画了两个属性及其层级关系:观测充分性(保留所有预测信息)和控制充分性(保留与决策相关的信息)。利用这种二分性,我们推导出了一个上下文证据下界 (ELBO) 风格的目标函数,该函数将表示学习与策略学习清晰地分离,并使用瓶颈上下文策略优化 (Bottlenecked Contextual Policy Optimization, BCPO) 对其进行优化。BCPO 是一种在任何 off-policy 策略学习器之前放置一个变分信息瓶颈编码器的算法。在具有变化物理参数的标准连续控制基准上,BCPO 在使用更少样本的同时,匹配或超越了其他基线方法,并在远离训练环境的情况下保持性能。该框架统一了基于上下文的 RL 的理论、诊断和实践。
引用
@article{arxiv.2507.19437,
title = {Observations Meet Actions: Learning Control-Sufficient Representations for Robust Policy Generalization},
author = {Yuliang Gu and Hongpeng Cao and Marco Caccamo and Naira Hovakimyan},
journal= {arXiv preprint arXiv:2507.19437},
year = {2025}
}