基于ODD状态校正与ODD动作抑制的离线强化学习
机器学习
2024-11-04 v4 人工智能
摘要
在离线强化学习(RL)中,针对ODD动作问题已是焦点,但我们认为也存在ODD状态问题,这会影响性能却鲜有被探讨。这种问题描述的是在测试阶段代理遇到离线数据集之外的状态时,导致行为不可控且性能下降。为此,我们提出了SCAS方法,一种统一ODD状态校正和ODD动作抑制的简单而有效的方法。技术上,SCAS实现了价值感知的ODD状态校正,能够纠正代理从ODD状态转移到高价值in-distribution状态。理论和实证结果表明,SCAS也具有抑制ODD动作的效果。在标准离线RL基准测试中,SCAS无需额外调参即可取得优异性能。此外,凭借其ODD状态校正功能,SCAS在环境扰动下展现出增强的鲁棒性。
引用
@article{arxiv.2410.19400,
title = {Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression},
author = {Yixiu Mao and Qi Wang and Chen Chen and Yun Qu and Xiangyang Ji},
journal= {arXiv preprint arXiv:2410.19400},
year = {2024}
}
备注
Accepted to NeurIPS 2024