中文

信任状态前请双重核查:置信感知的双向离线基于模型的想象

机器学习 2022-10-11 v2 人工智能

摘要

无模型离线强化学习(RL)方法的所学策略常被约束在数据集的支持内,以避免可能的危险分布外动作或状态,这使其难以处理支持外区域。基于模型的 RL 方法通过用训练好的前向或反向动力学模型生成想象轨迹,提供了更丰富的数据集并有益于泛化。然而,想象的转移可能不准确,从而降级底层离线 RL 方法的性能。在本文中,我们提出利用训练好的双向动力学模型与带双重核查的滚动策略来扩充离线数据集。我们通过信任前向模型与反向模型达成一致的样本来引入保守性。我们的方法,即置信感知的双向离线基于模型的想象,生成可靠样本且可与任意无模型离线 RL 方法结合。在 D4RL 基准上的实验结果表明,我们的方法显著提升了现有无模型离线 RL 算法的性能,并取得了相对于基线方法具竞争力或更优的分数。

关键词

引用

@article{arxiv.2206.07989,
  title  = {Double Check Your State Before Trusting It: Confidence-Aware Bidirectional Offline Model-Based Imagination},
  author = {Jiafei Lyu and Xiu Li and Zongqing Lu},
  journal= {arXiv preprint arXiv:2206.07989},
  year   = {2022}
}

备注

NeurIPS 2022