学会撤销:带可逆性信号的回滚增强强化学习
机器学习
2025-10-17 v1
摘要
本文提出了一种可逆学习框架,以提高基于价值的强化学习智能体的鲁棒性和效率,解决了在部分不可逆环境中对价值高估和不稳定性的脆弱性。该框架有两个互补的核心机制:一个经验导出的转移可逆性度量,称为Phi(s, a),以及一个选择性状态回滚操作。我们引入了一个在线逐状态-动作估计器,称为Phi,它量化了在固定视界K内返回到先前状态的可能性。该度量用于在时序差分更新期间动态调整惩罚项,将可逆性意识直接整合到价值函数中。该系统还包括一个选择性回滚算子。当一个动作产生的期望回报明显低于其瞬时估计值,并违反预定义阈值时,智能体将受到惩罚并返回到前一个状态,而不是继续前进。这中断了次优的高风险轨迹,并避免了灾难性步骤。通过结合可逆性感知评估和有针对性的回滚,该方法提高了安全性、性能和稳定性。在CliffWalking v0领域,该框架将灾难性坠落减少了超过99.8%,并使平均回合回报提高了55%。在Taxi v3领域,它抑制了超过或等于99.9%的非法动作,并实现了65.7%的累积奖励提升,同时在两个环境中都显著降低了奖励方差。消融研究证实,回滚机制是这些安全和性能提升背后的关键组成部分,标志着向安全可靠的序列决策迈出了坚实的一步。
引用
@article{arxiv.2510.14503,
title = {Learning to Undo: Rollback-Augmented Reinforcement Learning with Reversibility Signals},
author = {Andrejs Sorstkins and Omer Tariq and Muhammad Bilal},
journal= {arXiv preprint arXiv:2510.14503},
year = {2025}
}
备注
Submitted PLOS ONE