中文

RAMAC:多模态风险感知离线强化学习及行为正则化的作用

机器学习 2025-12-09 v2 人工智能

摘要

在无法进行在线数据收集的安全关键领域,离线强化学习(RL)提供了一种极具吸引力的替代方案,但其前提是策略必须在获得高回报的同时不引发灾难性的下尾风险。以往关于风险规避离线 RL 的工作以牺牲价值或基于模型的悲观主义为代价来换取安全性,且受限的策略类限制了策略的表达能力;而以行为克隆(BC)为目标训练的基于扩散/流模型的表达性生成策略仅在风险中性设置中被使用。在此,我们通过引入风险感知多模态 Actor-Critic(RAMAC)来解决这一空白,该方法将表达性生成 Actor 与分布式 Critic 相结合,据我们所知,这是首个学习风险感知表达性生成策略的无模型方法。RAMAC 对一个复合目标求导,该目标在 BC 损失中加入条件风险价值(CVaR)项,从而在复杂的多模态场景中实现风险敏感学习。由于分布外(OOD)动作是离线 RL 中灾难性失败的主要驱动因素,我们进一步分析了近期 BC 正则化风险规避离线 RL 中先验锚定扰动方案下的 OOD 行为。这阐明了为何将表达性生成策略直接约束在数据集支撑集上的行为正则化目标,能为现代表达性策略提供一种有效且风险无关的 OOD 动作抑制机制。我们用基于扩散的 Actor 实例化 RAMAC,既用它在一个二维风险 Bandit 中阐释分析,又在 Stochastic-D4RL 基准上部署 OOD 动作检测器,实证验证了我们的见解。在这些任务中,我们在保持高回报的同时观察到 CVaR0.1\mathrm{CVaR}_{0.1} 的一致提升。我们的实现可在 GitHub 获取:https://github.com/KaiFukazawa/RAMAC.git

关键词

引用

@article{arxiv.2510.02695,
  title  = {RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization},
  author = {Kai Fukazawa and Kunal Mundada and Iman Soltani},
  journal= {arXiv preprint arXiv:2510.02695},
  year   = {2025}
}