中文

离线基于模型的强化学习的对偶对齐最大最小优化

机器学习 2025-10-01 v3 人工智能

摘要

离线强化学习智能体由于合成数据与真实数据之间的分布不匹配而面临显著的部署挑战。虽然大多数先前的研究都集中在提高合成采样的保真度和引入离策略机制上,但直接集成的范式往往无法确保在存在偏差的模型和底层环境动态中保持一致的策略行为,这本质上源于行为策略和学习策略之间的差异。在本文中,我们首先在优化期望回报时将焦点从模型可靠性转移到策略差异上,然后自洽地整合合成数据,推导出一种新颖的演员-评论家范式,即双重对齐最大最小优化。这是一个统一的框架,旨在确保模型-环境策略一致性以及合成数据和离线数据的兼容性。内部最小化执行双重保守价值估计,对齐策略和轨迹以避免分布外状态和动作,而外部最大化确保策略改进与内部价值估计保持一致。实证评估表明,DAMO 有效地确保了模型和策略的对齐,在多种基准任务中取得了有竞争力的性能。

关键词

引用

@article{arxiv.2502.00850,
  title  = {Dual Alignment Maximin Optimization for Offline Model-based RL},
  author = {Chi Zhou and Wang Luo and Haoran Li and Congying Han and Tiande Guo and Zicheng Zhang},
  journal= {arXiv preprint arXiv:2502.00850},
  year   = {2025}
}