LRT-Diffusion:面向扩散策略的校准化风险感知引导
机器学习
2026-02-20 v2 人工智能
摘要
扩散策略在离线强化学习(RL)中表现优异,但通常由缺乏统计风险概念的启发式方法进行引导。我们提出了 LRT-Diffusion,一种具备风险感知采样规则的方法,将每个去噪步骤视为在无条件先验与状态条件策略头之间进行的顺序假设检验。具体而言,我们累积对数似然比,并通过一个在 H0 下校准为满足用户指定 Type-I 水平 alpha 的逻辑控制器来门控条件均值。这将引导从固定的推力转化为具有用户可解释风险预算的证据驱动调整。重要的是,我们在保留标准 DDPM 结构(两个带有标准 epsilon-预测头)进行训练的同时,实现了 LRT 引导。LRT 引导可与 Q 梯度自然组合:批判性梯度更新可在无条件均值、LRT 门控均值或两者的混合上进行,暴露了从开发到保守的连续谱。我们在训练和测试时间一致地对状态和动作进行标准化,并报告状态条件下的 out-of-distribution (OOD) 指标。于 D4RL MuJoCo 任务上,LRT-Diffusion 在实现 alpha 设定值的同时,优于强 Q 引导基线改善了 return-OOD 抗衡。理论上,我们建立了水平-alpha 校准、简洁稳定性界限以及展示 LRT 在何时超过 Q 引导——特别是在离支持误差占主导地位时。总体而言,LRT-Diffusion 是一种即插即用的方法,为离线 RL 中的扩散策略添加了原则性、校准化的风险控制。
引用
@article{arxiv.2510.24983,
title = {LRT-Diffusion: Calibrated Risk-Aware Guidance for Diffusion Policies},
author = {Ximan Sun and Xiang Cheng},
journal= {arXiv preprint arXiv:2510.24983},
year = {2026}
}