中文

学会撤销:带可逆性信号的回滚增强强化学习

机器学习 2025-10-17 v1

摘要

本文提出了一种可逆学习框架,以提高基于价值的强化学习智能体的鲁棒性和效率,解决了在部分不可逆环境中对价值高估和不稳定性的脆弱性。该框架有两个互补的核心机制:一个经验导出的转移可逆性度量,称为Phi(s, a),以及一个选择性状态回滚操作。我们引入了一个在线逐状态-动作估计器,称为Phi,它量化了在固定视界K内返回到先前状态的可能性。该度量用于在时序差分更新期间动态调整惩罚项,将可逆性意识直接整合到价值函数中。该系统还包括一个选择性回滚算子。当一个动作产生的期望回报明显低于其瞬时估计值,并违反预定义阈值时,智能体将受到惩罚并返回到前一个状态,而不是继续前进。这中断了次优的高风险轨迹,并避免了灾难性步骤。通过结合可逆性感知评估和有针对性的回滚,该方法提高了安全性、性能和稳定性。在CliffWalking v0领域,该框架将灾难性坠落减少了超过99.8%,并使平均回合回报提高了55%。在Taxi v3领域,它抑制了超过或等于99.9%的非法动作,并实现了65.7%的累积奖励提升,同时在两个环境中都显著降低了奖励方差。消融研究证实,回滚机制是这些安全和性能提升背后的关键组成部分,标志着向安全可靠的序列决策迈出了坚实的一步。

关键词

引用

@article{arxiv.2510.14503,
  title  = {Learning to Undo: Rollback-Augmented Reinforcement Learning with Reversibility Signals},
  author = {Andrejs Sorstkins and Omer Tariq and Muhammad Bilal},
  journal= {arXiv preprint arXiv:2510.14503},
  year   = {2025}
}

备注

Submitted PLOS ONE