遗憾感知策略优化:用于延迟伤害下重放抑制的环境级记忆
机器学习
2026-04-10 v1 人工智能
摘要
强化学习(RL)中的安全性通常通过目标塑造来执行,同时保持环境动力学相对于可观测状态-动作对是平稳的。在延迟伤害下,这可能导致重放:在洗涤期后,在匹配的可观测条件下重新引入相同的刺激会重现类似的伤害级联。我们引入了重放抑制诊断(RSD),一种受控的暴露-衰减-重放协议,用于在冻结策略评估下隔离这一失效模式。我们证明,在平稳可观测转移核下,在不引起重放时动作分布的持续偏移的情况下,重放无法被结构性地抑制。受平台中介系统的启发,我们提出了遗憾感知策略优化(RAPO),它通过持久伤害追踪和疤痕字段增强环境,并应用有界的、质量保持的转移重加权,以减少历史上有害区域的可达性。在图扩散任务(50-1000节点)上,RAPO 抑制了重放,将再放大增益(RAG)从 0.98 降至 0.33(在 250 节点图上),同时保留了 82% 的任务回报。仅在重放期间禁用转移变形恢复了再放大(RAG 0.91),将环境级变形隔离为因果机制。
引用
@article{arxiv.2604.07428,
title = {Regret-Aware Policy Optimization: Environment-Level Memory for Replay Suppression under Delayed Harm},
author = {Prakul Sunil Hiremath},
journal= {arXiv preprint arXiv:2604.07428},
year = {2026}
}
备注
18 pages, 3 figures. Includes theoretical analysis and experiments on graph diffusion environments