面向离线强化学习的目标对齐变换器:Double Check My Desired Return
机器学习
2025-09-30 v2
摘要
离线强化学习(RL)在机器人控制、自动驾驶和医疗决策等领域取得了显著进展。大多数现有方法主要致力于训练最大化给定数据集累积回报的策略。然而,许多实际应用需要对策略性能水平进行精确控制,而非仅追求最佳回报。强化学习通过监督学习(RvS)将离线 RL 表述为序列建模任务,实现对不同目标回报的条件化,从而提取多样化策略。然而,现有 RvS 变换器,如 Decision Transformer(DT),在将实际获得的回报与指定目标回报可靠对齐方面困难,尤其是在稀缺回报的插值或超出数据集的外推时。为此,我们提出了 Doctor,一种 novel 方法,通过目标对齐对变换器进行双重检查。Doctor 集成了监督学习(SL)和时序差分(TD)学习的优势,联合优化动作预测和价值估计。在推断阶段,Doctor 引入双重检查机制:首先围绕期望的目标回报采样动作,然后用价值函数进行验证。这确保了预测动作与期望目标回报之间的更精确对齐。在 D4RL 和 EpiCare 基准上进行评估,Doctor 证明对齐控制可获得更强的性能和可调的 expertise,显示其在广泛任务中有效。
引用
@article{arxiv.2508.16420,
title = {Double Check My Desired Return: Transformer with Target Alignment for Offline Reinforcement Learning},
author = {Yue Pei and Hongming Zhang and Chao Gao and Martin Müller and Mengxiao Zhu and Hao Sheng and Ziliang Chen and Liang Lin and Haogang Zhu},
journal= {arXiv preprint arXiv:2508.16420},
year = {2025}
}