中文

用于时延鲁棒策略优化的基于信念的离线强化学习

机器学习 2026-02-12 v2 人工智能

摘要

强化学习(RL)智能体的离线到在线部署必须弥合两个差距:(1) 仿真到现实的差距,即真实系统增加了仿真中不存在的延迟和其他缺陷;(2) 交互差距,即纯粹离线训练的策略在在线执行期间会面临分布外状态,因为收集新的交互数据成本高昂或风险极大。因此,智能体必须从静态、无延迟的数据集泛化到动态、易延迟的环境中。标准的离线 RL 从无延迟日志中学习,但必须在破坏马尔可夫假设并损害性能的延迟下行动。我们引入了 DT-CORL(Delay-Transformer belief policy Constrained Offline RL,时延 Transformer 信念策略约束离线 RL),这是一个旨在应对部署时延迟动态的离线 RL 框架。DT-CORL (i) 使用基于 Transformer 的信念预测器产生时延鲁棒动作,即使它在训练期间从未见过延迟观测;(ii) 比朴素的历史增强基线具有显著更高的样本效率。在具有多种延迟设置的 D4RL 基准上的实验表明,DT-CORL 始终优于历史增强和普通基于信念的方法,在保持数据效率的同时缩小了仿真到现实的延迟差距。

关键词

引用

@article{arxiv.2506.00131,
  title  = {Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization},
  author = {Simon Sinong Zhan and Qingyuan Wu and Philip Wang and Frank Yang and Xiangyu Shi and Chao Huang and Qi Zhu},
  journal= {arXiv preprint arXiv:2506.00131},
  year   = {2026}
}